8 nodes / 1024GB aggregate 12.5 GB/s link

96 models / sorted by best_quality

Runs comfortably
GLM-5.3-Flash UD-IQ1_S Unsloth
93.1GB 1000k ctx
FIT Runs comfortably
SPEED 29 tok/s
ⓘ estimated
MEMORY 93/1024GB
GLM-5.3-Flash UD-Q4_K_XL Unsloth
200.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.22 tok/s
distributed - link bound
MEMORY 200/1024GB
GLM-5.3-Flash UD-IQ3_XXS Unsloth
120.0GB 1000k ctx
FIT Runs comfortably
SPEED 22 tok/s
ⓘ estimated
MEMORY 120/1024GB
GLM-5.3-Flash UD-Q2_K_XL Unsloth
109.0GB 1000k ctx
FIT Runs comfortably
SPEED 24 tok/s
ⓘ estimated
MEMORY 109/1024GB
510.3GB 1000k ctx
FIT Runs comfortably
SPEED 0.16 tok/s
distributed - link bound
MEMORY 510/1024GB
260.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.32 tok/s
distributed - link bound
MEMORY 260/1024GB
DeepSeek V4 Flash 0731 UD-Q8_K_XL Unsloth
162.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.33 tok/s
distributed - link bound
MEMORY 162/1024GB
DeepSeek V4 Flash 0731 UD-Q4_K_XL Unsloth
155.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.34 tok/s
distributed - link bound
MEMORY 155/1024GB
244.0GB 262k ctx
FIT Runs comfortably
SPEED 0.01 tok/s
distributed - link bound
MEMORY 244/1024GB
286.0GB 262k ctx
FIT Runs comfortably
SPEED 0.01 tok/s
distributed - link bound
MEMORY 286/1024GB
331.0GB 262k ctx
FIT Runs comfortably
SPEED 0.01 tok/s
distributed - link bound
MEMORY 331/1024GB
429.0GB 262k ctx
FIT Runs comfortably
SPEED 0.01 tok/s
distributed - link bound
MEMORY 429/1024GB
Qwen3.8-Flash-Next UD-IQ1_S Unsloth
72.5GB 262k ctx
FIT Runs comfortably
SPEED 43 tok/s
ⓘ estimated
MEMORY 73/1024GB
GLM 5.2 Q5_K_M Unsloth
510.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.09 tok/s
distributed - link bound
MEMORY 510/1024GB
GLM 5.2 Q4_K_M Unsloth
410.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.11 tok/s
distributed - link bound
MEMORY 410/1024GB
GLM 5.2 Q3_K_M Unsloth
365.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.12 tok/s
distributed - link bound
MEMORY 365/1024GB
GLM 5.2 Q2_K Unsloth
240.0GB 1000k ctx
FIT Runs comfortably
SPEED 0.19 tok/s
distributed - link bound
MEMORY 240/1024GB
368.0GB 128k ctx
FIT Runs comfortably
SPEED 0.12 tok/s
distributed - link bound
MEMORY 368/1024GB
188.0GB 128k ctx
FIT Runs comfortably
SPEED 0.23 tok/s
distributed - link bound
MEMORY 188/1024GB
71.1GB 262k ctx
FIT Runs comfortably
SPEED 25 tok/s
ⓘ estimated
MEMORY 71/1024GB
37.8GB 262k ctx
FIT Runs comfortably
SPEED 48 tok/s
ⓘ estimated
MEMORY 38/1024GB
29.2GB 262k ctx
FIT Runs comfortably
SPEED 62 tok/s
ⓘ estimated
MEMORY 29/1024GB
25.3GB 262k ctx
FIT Runs comfortably
SPEED 71 tok/s
ⓘ estimated
MEMORY 25/1024GB
21.7GB 262k ctx
FIT Runs comfortably
SPEED 83 tok/s
ⓘ estimated
MEMORY 22/1024GB
20.0GB 262k ctx
FIT Runs comfortably
SPEED 87 tok/s
ⓘ estimated
MEMORY 20/1024GB
37.0GB 262k ctx
FIT Runs comfortably
SPEED 47 tok/s
ⓘ estimated
MEMORY 37/1024GB
16.0GB 10000k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 16/1024GB
28.0GB 10000k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 28/1024GB
56.0GB 10000k ctx
FIT Runs comfortably
SPEED 3 tok/s
ⓘ estimated
MEMORY 56/1024GB
125.0GB 128k ctx
FIT Runs comfortably
SPEED 13 tok/s
ⓘ estimated
MEMORY 125/1024GB
68.0GB 128k ctx
FIT Runs comfortably
SPEED 24 tok/s
ⓘ estimated
MEMORY 68/1024GB
Qwen3.8-27B UD-Q4_K_XL Unsloth
17.6GB 262k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 18/1024GB
Qwen3.8-27B UD-Q2_K_XL Unsloth
9.8GB 262k ctx
FIT Runs comfortably
SPEED 15 tok/s
ⓘ estimated
MEMORY 10/1024GB
Qwen3.8-27B UD-IQ1_S Unsloth
6.2GB 262k ctx
FIT Runs comfortably
SPEED 24 tok/s
ⓘ estimated
MEMORY 6/1024GB
Qwen3.8-27B NVFP4 Unsloth
15.2GB 262k ctx
FIT Runs comfortably
SPEED 10 tok/s
ⓘ estimated
MEMORY 15/1024GB
Gemma 4 31B NVFP4
16.0GB 256k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 16/1024GB
61.4GB 256k ctx
FIT Runs comfortably
SPEED 2 tok/s
ⓘ estimated
MEMORY 61/1024GB
32.6GB 256k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 33/1024GB
18.0GB 256k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 18/1024GB
Gemma 4 31B Q4_K_M
18.3GB 256k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 18/1024GB
50.0GB 256k ctx
FIT Runs comfortably
SPEED 20 tok/s
ⓘ estimated
MEMORY 50/1024GB
25.0GB 256k ctx
FIT Runs comfortably
SPEED 40 tok/s
ⓘ estimated
MEMORY 25/1024GB
13.0GB 256k ctx
FIT Runs comfortably
SPEED 76 tok/s
ⓘ estimated
MEMORY 13/1024GB
14.0GB 256k ctx
FIT Runs comfortably
SPEED 71 tok/s
ⓘ estimated
MEMORY 14/1024GB
28.0GB 128k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 28/1024GB
Qwen3.6 27B Q4_K_M
16.5GB 128k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 17/1024GB
Qwen3 32B Q8_0
34.0GB 128k ctx
FIT Runs comfortably
SPEED 4 tok/s
ⓘ estimated
MEMORY 34/1024GB
Qwen3 32B Q6_K
28.5GB 128k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 29/1024GB
Qwen3 32B Q5_K_M
24.5GB 128k ctx
FIT Runs comfortably
SPEED 6 tok/s
ⓘ estimated
MEMORY 25/1024GB
Qwen3 32B Q4_K_M
20.0GB 128k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 20/1024GB
32.0GB 1000k ctx
FIT Runs comfortably
SPEED 41 tok/s
ⓘ estimated
MEMORY 32/1024GB
18.4GB 262k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 18/1024GB
58.0GB 1000k ctx
FIT Runs comfortably
SPEED 23 tok/s
ⓘ estimated
MEMORY 58/1024GB
60.0GB 1000k ctx
FIT Runs comfortably
SPEED 22 tok/s
ⓘ estimated
MEMORY 60/1024GB
Ornith-1.5-9B Q4_K_M
5.8GB 262k ctx
FIT Runs comfortably
SPEED 26 tok/s
ⓘ estimated
MEMORY 6/1024GB
9.8GB 262k ctx
FIT Runs comfortably
SPEED 15 tok/s
ⓘ estimated
MEMORY 10/1024GB
Ornith-1.5-9B Q5_K_M
6.6GB 262k ctx
FIT Runs comfortably
SPEED 23 tok/s
ⓘ estimated
MEMORY 7/1024GB
7.6GB 262k ctx
FIT Runs comfortably
SPEED 20 tok/s
ⓘ estimated
MEMORY 8/1024GB
31.0GB 128k ctx
FIT Runs comfortably
SPEED 49 tok/s
ⓘ estimated
MEMORY 31/1024GB
Qwen3 30B A3B Q4_K_M
15.5GB 128k ctx
FIT Runs comfortably
SPEED 98 tok/s
ⓘ estimated
MEMORY 16/1024GB
Phi-4 14B Q8_0
15.0GB 16k ctx
FIT Runs comfortably
SPEED 10 tok/s
ⓘ estimated
MEMORY 15/1024GB
Phi-4 14B FP16
29.0GB 16k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 29/1024GB
Phi-4 14B Q4_K_M
8.5GB 16k ctx
FIT Runs comfortably
SPEED 18 tok/s
ⓘ estimated
MEMORY 9/1024GB
20.1GB 256k ctx
FIT Runs comfortably
SPEED 54 tok/s
ⓘ estimated
MEMORY 20/1024GB
62.4GB 256k ctx
FIT Runs comfortably
SPEED 17 tok/s
ⓘ estimated
MEMORY 62/1024GB
42.0GB 128k ctx
FIT Runs comfortably
SPEED 4 tok/s
ⓘ estimated
MEMORY 42/1024GB
74.0GB 128k ctx
FIT Runs comfortably
SPEED 2 tok/s
ⓘ estimated
MEMORY 74/1024GB
21.5GB 128k ctx
FIT Runs comfortably
SPEED 7 tok/s
ⓘ estimated
MEMORY 22/1024GB
30.0GB 128k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 30/1024GB
Qwen3 14B Q8_0
15.0GB 128k ctx
FIT Runs comfortably
SPEED 10 tok/s
ⓘ estimated
MEMORY 15/1024GB
Qwen3 14B Q4_K_M
9.0GB 128k ctx
FIT Runs comfortably
SPEED 17 tok/s
ⓘ estimated
MEMORY 9/1024GB
13.0GB 128k ctx
FIT Runs comfortably
SPEED 12 tok/s
ⓘ estimated
MEMORY 13/1024GB
Gemma 4 12B Q4_K_M
7.2GB 128k ctx
FIT Runs comfortably
SPEED 21 tok/s
ⓘ estimated
MEMORY 7/1024GB
28.0GB 128k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 28/1024GB
Gemma 3 27B Q4_K_M
17.0GB 128k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 17/1024GB
Qwen3 8B Q8_0
8.5GB 128k ctx
FIT Runs comfortably
SPEED 18 tok/s
ⓘ estimated
MEMORY 9/1024GB
Qwen3 8B Q4_K_M
5.2GB 128k ctx
FIT Runs comfortably
SPEED 29 tok/s
ⓘ estimated
MEMORY 5/1024GB
13.5GB 128k ctx
FIT Runs comfortably
SPEED 11 tok/s
ⓘ estimated
MEMORY 14/1024GB
Gemma 3 12B Q4_K_M
7.5GB 128k ctx
FIT Runs comfortably
SPEED 20 tok/s
ⓘ estimated
MEMORY 8/1024GB
26.5GB 32k ctx
FIT Runs comfortably
SPEED 21 tok/s
ⓘ estimated
MEMORY 27/1024GB
19.0GB 32k ctx
FIT Runs comfortably
SPEED 29 tok/s
ⓘ estimated
MEMORY 19/1024GB
13.2GB 128k ctx
FIT Runs comfortably
SPEED 11 tok/s
ⓘ estimated
MEMORY 13/1024GB
7.3GB 128k ctx
FIT Runs comfortably
SPEED 21 tok/s
ⓘ estimated
MEMORY 7/1024GB
Qwen3 4B Q4_K_M
2.6GB 32k ctx
FIT Runs comfortably
SPEED 58 tok/s
ⓘ estimated
MEMORY 3/1024GB
Phi-4 Mini Q4_K_M
2.5GB 128k ctx
FIT Runs comfortably
SPEED 60 tok/s
ⓘ estimated
MEMORY 3/1024GB
Phi-4 Mini Q8_0
4.1GB 128k ctx
FIT Runs comfortably
SPEED 37 tok/s
ⓘ estimated
MEMORY 4/1024GB
8.0GB 128k ctx
FIT Runs comfortably
SPEED 19 tok/s
ⓘ estimated
MEMORY 8/1024GB
16.0GB 128k ctx
FIT Runs comfortably
SPEED 9 tok/s
ⓘ estimated
MEMORY 16/1024GB
4.5GB 128k ctx
FIT Runs comfortably
SPEED 33 tok/s
ⓘ estimated
MEMORY 5/1024GB
Gemma 3 4B Q8_0
5.0GB 128k ctx
FIT Runs comfortably
SPEED 30 tok/s
ⓘ estimated
MEMORY 5/1024GB
Gemma 3 4B Q4_K_M
3.0GB 128k ctx
FIT Runs comfortably
SPEED 50 tok/s
ⓘ estimated
MEMORY 3/1024GB
3.5GB 128k ctx
FIT Runs comfortably
SPEED 43 tok/s
ⓘ estimated
MEMORY 4/1024GB
2.0GB 128k ctx
FIT Runs comfortably
SPEED 75 tok/s
ⓘ estimated
MEMORY 2/1024GB
18.0GB 128k ctx
FIT Runs comfortably
SPEED 8 tok/s
ⓘ estimated
MEMORY 18/1024GB
33.0GB 128k ctx
FIT Runs comfortably
SPEED 5 tok/s
ⓘ estimated
MEMORY 33/1024GB
60.0GB 128k ctx
FIT Runs comfortably
SPEED 3 tok/s
ⓘ estimated
MEMORY 60/1024GB

Run GLM-5.3-Flash in the cloud

No hardware? Host it - per-token API or flat subscription

InferenceNet per-token
$0.11
/MONTH
DeepInfra per-token
$0.18
/MONTH
Relace per-token
$0.19
/MONTH
GMICloud per-token
$0.22
/MONTH
OpenInference per-token
$0.24
/MONTH
Sail Research per-token
$0.27
/MONTH
Novita per-token
$0.27
/MONTH
Inceptron per-token
$0.29
/MONTH
Decart per-token
$0.31
/MONTH
Phala per-token
$0.31
/MONTH
StreamLake per-token
$0.34
/MONTH
CoreWeave per-token
$0.36
/MONTH
AtlasCloud per-token
$0.36
/MONTH
Fireworks per-token
$0.36
/MONTH
Friendli per-token
$0.36
/MONTH
Venice per-token
$0.36
/MONTH
Io Net per-token
$0.36
/MONTH
Z.AI per-token
$0.36
/MONTH
Modal per-token
Serverless GPU inference platform. Serves open-weight models including reason...
$0.36
/MONTH
Z.ai per-token
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
pricing may be outdated
$0.36
/MONTH
SiliconFlow per-token
$0.36
/MONTH
DigitalOcean per-token
$0.36
/MONTH
Together per-token
$0.36
/MONTH
Reka per-token
$0.36
/MONTH
Parasail per-token
$0.36
/MONTH
BaseTen per-token
$0.36
/MONTH
Near AI per-token
$0.36
/MONTH
Crusoe per-token
$0.36
/MONTH
NextBit per-token
$0.4
/MONTH
Morph per-token
$0.4
/MONTH
Wafer per-token
$0.7
/MONTH
Cloudflare per-token
$0.72
/MONTH
Z.ai Coding Plan Lite subscription
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
$10.0
/MONTH
OpenCode Go Go ($5 first month) subscription
Low-cost subscription for open coding models. $5 first month, then $10/month....
$10.0
/MONTH
Z.ai Coding Plan Pro subscription
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
$30.0
/MONTH
Z.ai Coding Plan Max subscription
Official API and platform for Zhipu AI's open-source GLM models. GLM-5.2 avai...
$80.0
/MONTH

Coding alternatives

Hosted coding assistants for comparison - per seat

Cursor Hobby
AI-first code editor. Uses frontier models (GPT-4, Claude). $20/user Business...
$0.0
/MONTH
GitHub Copilot Individual
AI coding assistant by GitHub. GPT-4o and Claude-based completions. $19/seat ...
$10.0
/MONTH
GitHub Copilot Business
AI coding assistant by GitHub. GPT-4o and Claude-based completions. $19/seat ...
$19.0
/MONTH
Cursor Pro
AI-first code editor. Uses frontier models (GPT-4, Claude). $20/user Business...
$20.0
/MONTH
GitHub Copilot Enterprise
AI coding assistant by GitHub. GPT-4o and Claude-based completions. $19/seat ...
$39.0
/MONTH
Cursor Business
AI-first code editor. Uses frontier models (GPT-4, Claude). $20/user Business...
$40.0
/MONTH

Per-token monthly figures are estimates at typical usage. Prices verified periodically - always confirm current pricing on the provider's website.

Sign in with GitHub to save this rig and get weekly model updates

Sign in with GitHub