DeepInfra: Models Intelligence, Performance & Price

DeepInfra
DeepInfra

This analysis is intended to support you in choosing the best model provided by DeepInfra for your use-case.

Most Intelligent

Updated
#1
GLM-5.3 (max)GLM-5.3 (max)
45
#2
GLM-5.3-FlashGLM-5.3-Flash
42
#3
Qwen3.8 2.4T A95BQwen3.8 2.4T A95B
40
#4
DeepSeek V4 Pro 0813 (max)DeepSeek V4 Pro 0813 (max)
36
#5
DeepSeek V4 Flash 0731 (max)DeepSeek V4 Flash 0731 (max)
34

Intelligence index

Total 105 models

Fastest

#1
gpt-oss-120b (high) (Turbo)gpt-oss-120b (high) (Turbo)
334 t/s
#2
Granite 4.2 3BGranite 4.2 3B
221 t/s
#3
Inkling (FP8)Inkling (FP8)
210 t/s
#4
Inkling SmallInkling Small
186 t/s
#5
Llama 3.1 Nemotron 70BLlama 3.1 Nemotron 70B
178 t/s

Output speed

Total 105 models

Lowest Price

#1
Llama 3.1 8B (Turbo, FP8)Llama 3.1 8B (Turbo, FP8)
$0.02
#2
Llama 3.1 8BLlama 3.1 8B
$0.02
#3
Granite 4.2 3BGranite 4.2 3B
$0.02
#4
Gemma 4 E4BGemma 4 E4B
$0.03
#5
Gemma 4 E4B (Non-reasoning)Gemma 4 E4B (Non-reasoning)
$0.03

Blended price (per 1M tokens)

Total 105 models

DeepInfra offers 105 models, each with different intelligence, performance, and pricing characteristics. Below is a comparison of the key metrics across models.

  • For intelligence, the top models on DeepInfra are GLM-5.3 (max) (45), GLM-5.3-Flash (42), and Qwen3.8 2.4T A95B (40).
  • For output speed, the fastest models are gpt-oss-120b (high) (Turbo) (334 t/s), Granite 4.2 3B (221 t/s), and Inkling (FP8) (210 t/s). Speed varies significantly across models, with a 87% difference between the fastest and slowest.
  • For latency, Llama 4 Maverick (FP8) (0.50s), Qwen3.5 122B A10B (Non-reasoning) (FP4) (0.62s), and Qwen3 30B (Non-reasoning) (FP8) (0.63s) offer the lowest time to first answer token.
  • For pricing, Llama 3.1 8B (Turbo, FP8) ($0.02), Llama 3.1 8B ($0.02), and Granite 4.2 3B ($0.02) offer the lowest blended prices per 1M tokens.
  • For context window size, GLM-5.2 (max) (FP4) (1M), DeepSeek V4 Pro (max) (FP4) (1M), and DeepSeek V4 Flash (high) (FP4) (1M) support the largest context windows on DeepInfra.

Highlights

Updated
Artificial Analysis Intelligence Index · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Intelligence Evaluations

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 incorporates 10 evaluations: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
Estimate (independent evaluation forthcoming)

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better
See more

Agentic knowledge work, (Elo-500)/2000

Agentic real-world work tasks, (Elo-500)/2000

Agentic SaaS workflows

Agentic coding & terminal use

Coding

Reasoning & knowledge

Professional document reasoning, All-pass

Physics reasoning

Long context reasoning

Legal agentic work, criterion pass rate

Agentic business operations

Quantitative analysis on spreadsheets & documents

Agentic tool use

Kubernetes incident root-cause analysis

Visual reasoning

Medical long context reasoning

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Context Window

Context Window

Context window: tokens limit · Higher is better

Pricing

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Performance Summary

Output Speed vs. Price

Output speed: output tokens per second · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Speed

Measured by Output Speed (tokens per second)

Output Speed

Output tokens per second · Higher is better

Latency

Measured by Time (seconds) to First Token

Latency: Time To First Answer Token

Seconds to first answer token received · Accounts for reasoning model 'thinking' time

End-to-End Response Time

Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed

End-to-End Response Time vs. Price

End-to-end response time: end-to-end seconds to output 500 tokens · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Further Analysis
Z AI logo
GLM-5.3 (max)
1.05M
Open
45
$2.16
107
1.16
24.62
18.77
Z AI logo
GLM-5.3-Flash
1M
Open
42
$0.43
19
1.46
132.36
104.72
Alibaba logo
Qwen3.8 2.4T A95B
262k
Open
40
$2.89
111
1.44
24.03
18.07
DeepSeek logo
DeepSeek V4 Pro 0813 (max)
1M
Open
36
$1.00
127
0.83
20.45
15.70
DeepSeek logo
DeepSeek V4 Flash 0731 (max)
1M
Open
34
$0.10
46
0.91
55.05
43.32
Z AI logo
GLM-5.2 (max) (FP4)
1.05M
Open
34
$0.65
65
1.07
39.67
30.88
Alibaba logo
Qwen3.8 27B (xhigh)
262k
Open
34
$0.65
30
1.95
86.20
67.39
DeepSeek logo
DeepSeek V4 Pro (max) (FP4)
1.05M
Open
30
$1.19
56
1.30
87.74
77.58
DeepSeek logo
DeepSeek V4 Pro (high) (FP4)
65.5k
Open
30*
--
58
1.18
43.95
34.19
MiniMax logo
MiniMax-M3
524k
Open
29
$0.44
16
19.17
170.90
121.39
Z AI logo
GLM-5 (FP4)
203k
Open
28*
--
72
1.45
51.66
43.24
Thinking Machines logo
Inkling Small
524k
Open
28*
--
186
0.57
14.00
10.75
Kimi logo
Kimi K2.6 (FP4)
262k
Open
27
$0.51
30
1.68
164.89
146.73
Z AI logo
GLM-5.1 (FP4)
203k
Open
26
$0.69
34
1.20
128.95
112.87
DeepSeek logo
DeepSeek V4 Flash (high) (FP4)
1.05M
Open
26*
--
34
1.76
52.90
36.44
Xiaomi logo
MiMo-V2.5-Pro
65.5k
Open
26
$0.43
38
1.48
67.55
52.86
Kimi logo
Kimi K2.7 Code
262k
Open
26
$0.39
37
1.03
73.85
59.47
Tencent logo
Hy3 (FP8)
262k
Open
25
$0.07
103
1.16
25.38
19.38
Xiaomi logo
MiMo-V2.5
262k
Open
25*
--
15
1.37
173.55
137.74
Thinking Machines logo
Inkling (FP8)
131k
Open
25
$0.81
210
0.70
12.61
9.53
InclusionAI logo
Ling 3.0 Flash
131k
Open
25*
--
51
2.38
51.47
39.27
Z AI logo
GLM-5.1 (Non-reasoning) (FP4)
203k
Open
24*
--
34
0.98
15.64
--
DeepSeek logo
DeepSeek V4 Flash (max) (FP4)
1.05M
Open
24
$0.09
33
1.34
186.16
169.70
Kimi logo
Kimi K2.6 (Non-reasoning) (FP4)
262k
Open
24*
--
21
1.56
25.91
--
Kimi logo
Kimi K2.5
262k
Open
23*
--
33
1.59
106.22
89.55
NVIDIA logo
Nemotron 3 Ultra
262k
Open
23
$0.47
134
5.11
25.77
16.93
NVIDIA logo
Nemotron 3 Ultra BF16
262k
Open
23
$0.92
166
3.48
20.17
13.68
Alibaba logo
Qwen3.5 27B (FP8)
262k
Open
23*
--
61
1.14
42.18
32.84
MiniMax logo
MiniMax-M2.5 (FP8)
197k
Open
23*
--
20
24.11
151.55
101.96
Z AI logo
GLM-4.7 (FP4)
203k
Open
22*
--
19
1.58
131.62
104.03
Z AI logo
GLM-5 (Non-reasoning) (FP8)
203k
Open
22*
--
84
1.09
7.02
--
DeepSeek logo
DeepSeek V3.2 (FP4)
164k
Open
21*
--
28
1.18
91.77
72.47
Alibaba logo
Qwen3.5 397B A17B (Non-reasoning) (FP8)
262k
Open
21*
--
42
1.11
13.09
--
Alibaba logo
Qwen3.6 27B FP8
262k
Open
21
$0.37
71
0.96
87.38
79.42
Alibaba logo
Qwen3.6 27B (Non-reasoning) FP8
262k
Open
20*
--
68
0.94
8.25
--
StepFun logo
Step 3.7 Flash
256k
Open
19*
--
168
0.66
15.54
11.91
Alibaba logo
Qwen3.5 27B (Non-reasoning) FP8
262k
Open
19*
--
59
1.11
9.62
--
Alibaba logo
Qwen3.5 35B A3B (FP8)
262k
Open
19*
--
141
0.73
18.44
14.17
Google logo
Gemma 4 31B
262k
Open
19*
--
21
2.02
106.64
81.23
Z AI logo
GLM-4.6 (FP4)
203k
Open
19*
--
36
1.03
70.04
55.21
Alibaba logo
Qwen3.5 397B A17B (FP8)
262k
Open
18
$0.23
44
1.01
85.24
72.81
Xiaomi logo
MiMo-V2.5-Pro (Non-reasoning)
65.5k
Open
18*
--
35
1.54
15.80
--
Alibaba logo
Qwen3.6 35B A3B (FP8)
262k
Open
18
$0.14
76
0.91
78.79
71.27
Alibaba logo
Qwen3.5 122B A10B (Non-reasoning) (FP4)
262k
Open
18*
--
157
0.62
3.81
--
Meta logo
Muse Glimmer (high)
131k
Open
17
$0.05
133
0.83
19.61
15.02
Z AI logo
GLM-4.7 (Non-reasoning) (FP4)
203k
Open
17*
--
16
1.43
33.43
--
Google logo
Gemma 4 26B A4B (FP8)
262k
Open
17*
--
32
1.04
80.38
63.47
DeepSeek logo
DeepSeek V3.2 (Non-reasoning)
164k
Open
16*
--
25
1.35
21.13
--
Alibaba logo
Qwen3.5 122B A10B (FP4)
262k
Open
16
$0.14
171
0.60
15.19
11.67
Alibaba logo
Qwen3.6 35B A3B (Non-reasoning) (FP8)
262k
Open
15*
--
85
0.78
6.67
--
Alibaba logo
Qwen3.5 35B A3B (Non-reasoning) FP8
262k
Open
15*
--
145
0.70
4.15
--
Z AI logo
GLM-4.7-Flash
203k
Open
15*
--
23
2.51
111.52
87.21
IBM logo
Granite 4.2 30B
131k
Open
15*
--
73
0.86
35.02
27.33
DeepSeek logo
DeepSeek V3.1 Terminus (Non-reasoning) (FP4)
164k
Open
14*
--
46
1.15
12.11
--
Google logo
Gemma 4 31B (Non-reasoning) (FP8)
262k
Open
14*
--
23
1.61
23.15
--
DeepSeek logo
DeepSeek V3.1 (Non-reasoning) (FP4)
164k
Open
14*
--
18
1.14
28.21
--
Google logo
Gemma 4 26B A4B (Non-reasoning) (FP8)
262k
Open
13*
--
31
0.82
16.97
--
Alibaba logo
Qwen3.5 4B (FP8)
262k
Open
13*
--
17
0.84
145.82
115.98
DeepSeek logo
DeepSeek R1 0528
164k
Open
13*
--
--
--
--
--
NVIDIA logo
Nemotron 3.5 Lightning (NVFP4)
262k
Open
13
$0.12
--
--
--
--
NVIDIA logo
Nemotron 3 Super
262k
Open
13
$0.48
--
--
--
--
Alibaba logo
Qwen3 235B A22B 2507 (FP8)
262k
Open
13
--
90
0.80
28.51
22.17
Alibaba logo
Qwen3 235B 2507 (FP8)
262k
Open
12*
--
21
0.78
24.49
--
Alibaba logo
Qwen3 Coder 480B (Turbo, FP4)
262k
Open
12*
--
59
0.90
9.42
--
OpenAI logo
gpt-oss-120b (high) (Turbo)
131k
Open
12
$0.11
334
0.74
8.23
5.99
OpenAI logo
gpt-oss-120b (high)
131k
Open
12
$0.03
48
0.65
52.38
41.38
IBM logo
Granite 4.2 8B
131k
Open
11
$0.02
89
0.87
29.00
22.50
Alibaba logo
Qwen3.5 4B (Non-reasoning) FP8
262k
Open
11*
--
13
0.85
39.27
--
OpenAI logo
gpt-oss-120b (low)
131k
Open
10*
--
48
0.66
52.95
41.83
Meta logo
Llama 4 Maverick (FP8)
1.05M
Open
10*
--
99
0.50
5.55
--
DeepSeek logo
DeepSeek V3 0324 (FP4)
164k
Open
10
$0.02
38
1.57
14.80
--
Alibaba logo
Qwen3 Next 80B A3B
262k
Open
10*
--
170
0.74
3.67
--
IBM logo
Granite 4.2 3B
131k
Open
9
$0.01
221
0.48
11.81
9.07
NVIDIA logo
Llama Nemotron Super 49B v1.5
131k
Open
9*
--
161
3.58
19.13
12.44
OpenAI logo
gpt-oss-20b (high)
131k
Open
9
$0.01
120
0.54
21.45
16.72
Google logo
Gemma 4 E4B
262k
Open
9*
--
42
0.85
60.71
47.89
NVIDIA logo
Nemotron 3 Nano
262k
Open
9
$0.02
107
11.97
35.29
18.66
Alibaba logo
Qwen3 32B (FP8)
41k
Open
9*
--
34
1.42
74.99
58.86
DeepSeek logo
DeepSeek V3 (Dec)
164k
Open
8
$0.02
22
0.89
23.70
--
Mistral logo
Mistral Small 3.2 (FP8)
128k
Open
8*
--
30
1.02
17.45
--
Alibaba logo
Qwen3 14B (FP8)
32.8k
Open
8*
--
54
0.88
46.94
36.84
Meta logo
Llama 4 Scout
328k
Open
8*
--
42
0.75
12.70
--
DeepSeek logo
DeepSeek R1 Distill Llama 70B
131k
Open
8*
--
--
--
--
--
Alibaba logo
Qwen2.5 72B
32.8k
Open
8*
--
24
2.43
23.31
--
Meta logo
Llama 3.3 70B (Turbo, FP8)
131k
Open
8*
--
18
2.37
30.52
--
Alibaba logo
Qwen3 30B (FP8)
41k
Open
8*
--
104
0.54
24.64
19.28
NVIDIA logo
NVIDIA Nemotron Nano 12B v2 VL (FP8)
131k
Open
7*
--
138
5.50
23.59
14.47
Google logo
Gemma 4 E4B (Non-reasoning)
262k
Open
7*
--
45
0.78
11.85
--
NVIDIA logo
NVIDIA Nemotron Nano 9B V2
131k
Open
7*
--
116
10.23
31.74
17.21
NVIDIA logo
Llama Nemotron Super 49B v1.5 (Non-reasoning)
131k
Open
7*
--
126
4.34
8.31
--
Alibaba logo
Qwen3 32B (Non-reasoning) (FP8)
41k
Open
7*
--
32
1.43
17.18
--
Mistral logo
Mistral Small 3.1
128k
Open
7
$0.02
36
0.87
14.58
--
NVIDIA logo
Llama 3.1 Nemotron 70B
131k
Open
7*
--
178
3.83
6.64
--
Meta logo
Llama 3.1 8B (Turbo, FP8)
131k
Open
7*
--
23
1.19
22.70
--
Meta logo
Llama 3.1 8B
131k
Open
7*
--
31
1.05
17.04
--
NVIDIA logo
Nemotron 3 Nano (Non-reasoning)
262k
Open
7*
--
107
0.70
5.38
--
NVIDIA logo
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)
131k
Open
7*
--
110
8.43
12.96
--
Alibaba logo
Qwen3 14B (Non-reasoning) (FP8)
41k
Open
7*
--
66
0.85
8.44
--
Mistral logo
Mistral Small 3
32.8k
Open
7*
--
46
0.91
11.79
--
Alibaba logo
Qwen3 30B (Non-reasoning) (FP8)
41k
Open
7*
--
104
0.63
5.43
--
Meta logo
Llama 3.1 70B
131k
Open
7*
--
35
2.41
16.74
--
Meta logo
Llama 3.1 70B (Turbo, FP8)
131k
Open
7*
--
30
2.28
19.17
--
Nous Research logo
Hermes 3 - Llama-3.1 70B
131k
Open
6*
--
30
2.10
18.65
--
Microsoft logo
Phi-4
16.4k
Open
6*
--
73
0.91
7.77
--
NVIDIA logo
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) (FP8)
131k
Open
6*
--
141
4.45
8.01
--
Meta logo
Llama 3.2 11B (Vision)
131k
Open
5*
--
21
1.69
25.53
--
Google logo
Gemma 3 27B
131k
Open
5
$0.16
23
1.37
22.79
--
Google logo
Gemma 3 4B
131k
Open
5*
--
21
1.20
25.42
--
Meta logo
Llama 3 8B
8.19k
Open
5*
--
--
--
--
--
Google logo
Gemma 3 12B
131k
Open
4
$0.13
35
0.98
15.31
--

Key definitions

Frequently Asked Questions

Common questions about DeepInfra