M3 Ultra 256GB

87 models / sorted by best_quality

Runs comfortably
GLM-5.3-Flash UD-Q4_K_XL Unsloth
200.0GB 1000k ctx
FIT Runs comfortably
SPEED 44 tok/s
ⓘ estimated
MEMORY 200/256GB
GLM-5.3-Flash UD-IQ3_XXS Unsloth
120.0GB 1000k ctx
FIT Runs comfortably
SPEED 73 tok/s
ⓘ estimated
MEMORY 120/256GB
GLM-5.3-Flash UD-Q2_K_XL Unsloth
109.0GB 1000k ctx
FIT Runs comfortably
SPEED 80 tok/s
ⓘ estimated
MEMORY 109/256GB
GLM-5.3-Flash UD-IQ1_S Unsloth
93.1GB 1000k ctx
FIT Runs comfortably
SPEED 94 tok/s
ⓘ estimated
MEMORY 93/256GB
DeepSeek V4 Flash 0731 UD-Q4_K_XL Unsloth
155.0GB 1000k ctx
FIT Runs comfortably
SPEED 69 tok/s
ⓘ estimated
MEMORY 155/256GB
DeepSeek V4 Flash 0731 UD-Q8_K_XL Unsloth
162.0GB 1000k ctx
FIT Runs comfortably
SPEED 66 tok/s
ⓘ estimated
MEMORY 162/256GB
Qwen3.8-Flash-Next UD-IQ1_S Unsloth
72.5GB 262k ctx
FIT Runs comfortably
SPEED 141 tok/s
ⓘ estimated
MEMORY 73/256GB
188.0GB 128k ctx
FIT Runs comfortably
SPEED 47 tok/s
ⓘ estimated
MEMORY 188/256GB
21.7GB 262k ctx
FIT Runs comfortably
SPEED 271 tok/s
ⓘ estimated
MEMORY 22/256GB
25.3GB 262k ctx
FIT Runs comfortably
SPEED 233 tok/s
ⓘ estimated
MEMORY 25/256GB
29.2GB 262k ctx
FIT Runs comfortably
SPEED 202 tok/s
ⓘ estimated
MEMORY 29/256GB
37.8GB 262k ctx
FIT Runs comfortably
SPEED 156 tok/s
ⓘ estimated
MEMORY 38/256GB
71.1GB 262k ctx
FIT Runs comfortably
SPEED 83 tok/s
ⓘ estimated
MEMORY 71/256GB
37.0GB 262k ctx
FIT Runs comfortably
SPEED 155 tok/s
ⓘ estimated
MEMORY 37/256GB
20.0GB 262k ctx
FIT Runs comfortably
SPEED 286 tok/s
ⓘ estimated
MEMORY 20/256GB
16.0GB 10000k ctx
FIT Runs comfortably
SPEED 31 tok/s
ⓘ estimated
MEMORY 16/256GB
28.0GB 10000k ctx
FIT Runs comfortably
SPEED 18 tok/s
ⓘ estimated
MEMORY 28/256GB
56.0GB 10000k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 56/256GB
125.0GB 128k ctx
FIT Runs comfortably
SPEED 42 tok/s
ⓘ estimated
MEMORY 125/256GB
68.0GB 128k ctx
FIT Runs comfortably
SPEED 77 tok/s
ⓘ estimated
MEMORY 68/256GB
Qwen3.8-27B UD-Q2_K_XL Unsloth
9.8GB 262k ctx
FIT Runs comfortably
SPEED 50 tok/s
ⓘ estimated
MEMORY 10/256GB
Qwen3.8-27B UD-IQ1_S Unsloth
6.2GB 262k ctx
FIT Runs comfortably
SPEED 79 tok/s
ⓘ estimated
MEMORY 6/256GB
Qwen3.8-27B NVFP4 Unsloth
15.2GB 262k ctx
FIT Runs comfortably
SPEED 32 tok/s
ⓘ estimated
MEMORY 15/256GB
Qwen3.8-27B UD-Q4_K_XL Unsloth
17.6GB 262k ctx
FIT Runs comfortably
SPEED 28 tok/s
ⓘ estimated
MEMORY 18/256GB
18.0GB 256k ctx
FIT Runs comfortably
SPEED 27 tok/s
ⓘ estimated
MEMORY 18/256GB
32.6GB 256k ctx
FIT Runs comfortably
SPEED 15 tok/s
ⓘ estimated
MEMORY 33/256GB
61.4GB 256k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 61/256GB
Gemma 4 31B NVFP4
16.0GB 256k ctx
FIT Runs comfortably
SPEED 31 tok/s
ⓘ estimated
MEMORY 16/256GB
Gemma 4 31B Q4_K_M
18.3GB 256k ctx
FIT Runs comfortably
SPEED 27 tok/s
ⓘ estimated
MEMORY 18/256GB
50.0GB 256k ctx
FIT Runs comfortably
SPEED 65 tok/s
ⓘ estimated
MEMORY 50/256GB
25.0GB 256k ctx
FIT Runs comfortably
SPEED 130 tok/s
ⓘ estimated
MEMORY 25/256GB
13.0GB 256k ctx
FIT Runs comfortably
SPEED 250 tok/s
ⓘ estimated
MEMORY 13/256GB
14.0GB 256k ctx
FIT Runs comfortably
SPEED 232 tok/s
ⓘ estimated
MEMORY 14/256GB
28.0GB 128k ctx
FIT Runs comfortably
SPEED 18 tok/s
ⓘ estimated
MEMORY 28/256GB
Qwen3.6 27B Q4_K_M
16.5GB 128k ctx
FIT Runs comfortably
SPEED 30 tok/s
ⓘ estimated
MEMORY 17/256GB
Qwen3 32B Q8_0
34.0GB 128k ctx
FIT Runs comfortably
SPEED 14 tok/s
ⓘ estimated
MEMORY 34/256GB
Qwen3 32B Q4_K_M
20.0GB 128k ctx
FIT Runs comfortably
SPEED 25 tok/s
ⓘ estimated
MEMORY 20/256GB
Qwen3 32B Q5_K_M
24.5GB 128k ctx
FIT Runs comfortably
SPEED 20 tok/s
ⓘ estimated
MEMORY 25/256GB
Qwen3 32B Q6_K
28.5GB 128k ctx
FIT Runs comfortably
SPEED 17 tok/s
ⓘ estimated
MEMORY 29/256GB
Ornith-1.5-9B Q4_K_M
5.8GB 262k ctx
FIT Runs comfortably
SPEED 85 tok/s
ⓘ estimated
MEMORY 6/256GB
32.0GB 1000k ctx
FIT Runs comfortably
SPEED 135 tok/s
ⓘ estimated
MEMORY 32/256GB
58.0GB 1000k ctx
FIT Runs comfortably
SPEED 74 tok/s
ⓘ estimated
MEMORY 58/256GB
60.0GB 1000k ctx
FIT Runs comfortably
SPEED 72 tok/s
ⓘ estimated
MEMORY 60/256GB
Ornith-1.5-9B Q5_K_M
6.6GB 262k ctx
FIT Runs comfortably
SPEED 74 tok/s
ⓘ estimated
MEMORY 7/256GB
7.6GB 262k ctx
FIT Runs comfortably
SPEED 65 tok/s
ⓘ estimated
MEMORY 8/256GB
9.8GB 262k ctx
FIT Runs comfortably
SPEED 50 tok/s
ⓘ estimated
MEMORY 10/256GB
18.4GB 262k ctx
FIT Runs comfortably
SPEED 27 tok/s
ⓘ estimated
MEMORY 18/256GB
31.0GB 128k ctx
FIT Runs comfortably
SPEED 161 tok/s
ⓘ estimated
MEMORY 31/256GB
Qwen3 30B A3B Q4_K_M
15.5GB 128k ctx
FIT Runs comfortably
SPEED 322 tok/s
ⓘ estimated
MEMORY 16/256GB
Phi-4 14B Q8_0
15.0GB 16k ctx
FIT Runs comfortably
SPEED 33 tok/s
ⓘ estimated
MEMORY 15/256GB
Phi-4 14B FP16
29.0GB 16k ctx
FIT Runs comfortably
SPEED 17 tok/s
ⓘ estimated
MEMORY 29/256GB
Phi-4 14B Q4_K_M
8.5GB 16k ctx
FIT Runs comfortably
SPEED 58 tok/s
ⓘ estimated
MEMORY 9/256GB
62.4GB 256k ctx
FIT Runs comfortably
SPEED 57 tok/s
ⓘ estimated
MEMORY 62/256GB
20.1GB 256k ctx
FIT Runs comfortably
SPEED 177 tok/s
ⓘ estimated
MEMORY 20/256GB
74.0GB 128k ctx
FIT Runs comfortably
SPEED 7 tok/s
ⓘ estimated
MEMORY 74/256GB
42.0GB 128k ctx
FIT Runs comfortably
SPEED 12 tok/s
ⓘ estimated
MEMORY 42/256GB
21.5GB 128k ctx
FIT Runs comfortably
SPEED 23 tok/s
ⓘ estimated
MEMORY 22/256GB
30.0GB 128k ctx
FIT Runs comfortably
SPEED 16 tok/s
ⓘ estimated
MEMORY 30/256GB
Qwen3 14B Q8_0
15.0GB 128k ctx
FIT Runs comfortably
SPEED 33 tok/s
ⓘ estimated
MEMORY 15/256GB
Qwen3 14B Q4_K_M
9.0GB 128k ctx
FIT Runs comfortably
SPEED 55 tok/s
ⓘ estimated
MEMORY 9/256GB
13.0GB 128k ctx
FIT Runs comfortably
SPEED 38 tok/s
ⓘ estimated
MEMORY 13/256GB
Gemma 4 12B Q4_K_M
7.2GB 128k ctx
FIT Runs comfortably
SPEED 68 tok/s
ⓘ estimated
MEMORY 7/256GB
28.0GB 128k ctx
FIT Runs comfortably
SPEED 18 tok/s
ⓘ estimated
MEMORY 28/256GB
Gemma 3 27B Q4_K_M
17.0GB 128k ctx
FIT Runs comfortably
SPEED 29 tok/s
ⓘ estimated
MEMORY 17/256GB
Qwen3 8B Q8_0
8.5GB 128k ctx
FIT Runs comfortably
SPEED 58 tok/s
ⓘ estimated
MEMORY 9/256GB
Qwen3 8B Q4_K_M
5.2GB 128k ctx
FIT Runs comfortably
SPEED 94 tok/s
ⓘ estimated
MEMORY 5/256GB
13.5GB 128k ctx
FIT Runs comfortably
SPEED 36 tok/s
ⓘ estimated
MEMORY 14/256GB
Gemma 3 12B Q4_K_M
7.5GB 128k ctx
FIT Runs comfortably
SPEED 66 tok/s
ⓘ estimated
MEMORY 8/256GB
26.5GB 32k ctx
FIT Runs comfortably
SPEED 67 tok/s
ⓘ estimated
MEMORY 27/256GB
19.0GB 32k ctx
FIT Runs comfortably
SPEED 94 tok/s
ⓘ estimated
MEMORY 19/256GB
13.2GB 128k ctx
FIT Runs comfortably
SPEED 37 tok/s
ⓘ estimated
MEMORY 13/256GB
7.3GB 128k ctx
FIT Runs comfortably
SPEED 67 tok/s
ⓘ estimated
MEMORY 7/256GB
Qwen3 4B Q4_K_M
2.6GB 32k ctx
FIT Runs comfortably
SPEED 189 tok/s
ⓘ estimated
MEMORY 3/256GB
Phi-4 Mini Q4_K_M
2.5GB 128k ctx
FIT Runs comfortably
SPEED 197 tok/s
ⓘ estimated
MEMORY 3/256GB
Phi-4 Mini Q8_0
4.1GB 128k ctx
FIT Runs comfortably
SPEED 120 tok/s
ⓘ estimated
MEMORY 4/256GB
8.0GB 128k ctx
FIT Runs comfortably
SPEED 61 tok/s
ⓘ estimated
MEMORY 8/256GB
16.0GB 128k ctx
FIT Runs comfortably
SPEED 31 tok/s
ⓘ estimated
MEMORY 16/256GB
4.5GB 128k ctx
FIT Runs comfortably
SPEED 109 tok/s
ⓘ estimated
MEMORY 5/256GB
Gemma 3 4B Q8_0
5.0GB 128k ctx
FIT Runs comfortably
SPEED 98 tok/s
ⓘ estimated
MEMORY 5/256GB
Gemma 3 4B Q4_K_M
3.0GB 128k ctx
FIT Runs comfortably
SPEED 164 tok/s
ⓘ estimated
MEMORY 3/256GB
3.5GB 128k ctx
FIT Runs comfortably
SPEED 140 tok/s
ⓘ estimated
MEMORY 4/256GB
2.0GB 128k ctx
FIT Runs comfortably
SPEED 246 tok/s
ⓘ estimated
MEMORY 2/256GB
18.0GB 128k ctx
FIT Runs comfortably
SPEED 27 tok/s
ⓘ estimated
MEMORY 18/256GB
33.0GB 128k ctx
FIT Runs comfortably
SPEED 15 tok/s
ⓘ estimated
MEMORY 33/256GB
60.0GB 128k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 60/256GB
Runs tight
244.0GB 262k ctx
FIT Runs tight
SPEED 2 tok/s
ⓘ estimated
MEMORY 244/256GB
GLM 5.2 Q2_K Unsloth
240.0GB 1000k ctx
FIT Runs tight
SPEED 38 tok/s
ⓘ estimated
MEMORY 240/256GB

Run GLM-5.3-Flash in the cloud

No hardware? Host it - per-token API or flat subscription

InferenceNet per-token
$0.11
/MONTH
DeepInfra per-token
$0.18
/MONTH
GMICloud per-token
$0.22
/MONTH
OpenInference per-token
$0.24
/MONTH
Relace per-token
$0.26
/MONTH
Sail Research per-token
$0.27
/MONTH
Novita per-token
$0.27
/MONTH
Inceptron per-token
$0.29
/MONTH
Decart per-token
$0.31
/MONTH
Phala per-token
$0.31
/MONTH
Io Net per-token
$0.32
/MONTH
StreamLake per-token
$0.34
/MONTH
Venice per-token
$0.36
/MONTH
Friendli per-token
$0.36
/MONTH
Z.AI per-token
$0.36
/MONTH
Modal per-token
Serverless GPU inference platform. Serves open-weight models including reason...
$0.36
/MONTH
Fireworks per-token
$0.36
/MONTH
AtlasCloud per-token
$0.36
/MONTH
CoreWeave per-token
$0.36
/MONTH
Z.ai per-token
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
pricing may be outdated
$0.36
/MONTH
SiliconFlow per-token
$0.36
/MONTH
DigitalOcean per-token
$0.36
/MONTH
Together per-token
$0.36
/MONTH
Reka per-token
$0.36
/MONTH
Parasail per-token
$0.36
/MONTH
BaseTen per-token
$0.36
/MONTH
Near AI per-token
$0.36
/MONTH
Crusoe per-token
$0.36
/MONTH
NextBit per-token
$0.4
/MONTH
Morph per-token
$0.4
/MONTH
Wafer per-token
$0.7
/MONTH
Cloudflare per-token
$0.72
/MONTH
Z.ai Coding Plan Lite subscription
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
$10.0
/MONTH
OpenCode Go Go ($5 first month) subscription
Low-cost subscription for open coding models. $5 first month, then $10/month....
$10.0
/MONTH
Z.ai Coding Plan Pro subscription
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
$30.0
/MONTH
Z.ai Coding Plan Max subscription
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
$80.0
/MONTH

Coding alternatives

Hosted coding assistants for comparison - per seat

Cursor Hobby
AI-first code editor. Uses frontier models (GPT-4, Claude). $20/user Business...
$0.0
/MONTH
GitHub Copilot Individual
AI coding assistant by GitHub. GPT-4o and Claude-based completions. $19/seat ...
$10.0
/MONTH
GitHub Copilot Business
AI coding assistant by GitHub. GPT-4o and Claude-based completions. $19/seat ...
$19.0
/MONTH
Cursor Pro
AI-first code editor. Uses frontier models (GPT-4, Claude). $20/user Business...
$20.0
/MONTH
GitHub Copilot Enterprise
AI coding assistant by GitHub. GPT-4o and Claude-based completions. $19/seat ...
$39.0
/MONTH
Cursor Business
AI-first code editor. Uses frontier models (GPT-4, Claude). $20/user Business...
$40.0
/MONTH

Per-token monthly figures are estimates at typical usage. Prices verified periodically - always confirm current pricing on the provider's website.

Sign in with GitHub to save this rig and get weekly model updates

Sign in with GitHub