DeepInfra: Models Intelligence, Performance & Price

DeepInfra
DeepInfra

This analysis is intended to support you in choosing the best model provided by DeepInfra for your use-case.

Most Intelligent

#1
MiMo-V2.6-ProMiMo-V2.6-Pro
46
#2
GLM-5.3 (max)GLM-5.3 (max)
45
#3
GLM-5.3-FlashGLM-5.3-Flash
42
#4
Qwen3.8 2.4T A95BQwen3.8 2.4T A95B
40
#5
DeepSeek V4.1 Flash (max)DeepSeek V4.1 Flash (max)
39

Intelligence Index

Total 107 models

Fastest

#1
Nemotron 3.5 Lightning (NVFP4)Nemotron 3.5 Lightning (NVFP4)
263 t/s
#2
Inkling SmallInkling Small
231 t/s
#3
NVIDIA Nemotron Nano 9B V2NVIDIA Nemotron Nano 9B V2
222 t/s
#4
Granite 4.2 3BGranite 4.2 3B
217 t/s
#5
Nemotron 3 NanoNemotron 3 Nano
201 t/s

Output speed

Total 107 models

Lowest Price

#1
Llama 3.1 8B (Turbo, FP8)Llama 3.1 8B (Turbo, FP8)
$0.02
#2
Llama 3.1 8BLlama 3.1 8B
$0.02
#3
Granite 4.2 3BGranite 4.2 3B
$0.02
#4
Gemma 4 E4BGemma 4 E4B
$0.03
#5
Gemma 4 E4B (non-reasoning)Gemma 4 E4B (non-reasoning)
$0.03

Blended price (per 1M tokens)

Total 107 models

DeepInfra offers 107 models, each with different intelligence, performance, and pricing characteristics. Below is a comparison of the key metrics across models.

  • For intelligence, the top models on DeepInfra are MiMo-V2.6-Pro (46), GLM-5.3 (max) (45), and GLM-5.3-Flash (42).
  • For output speed, the fastest models are Nemotron 3.5 Lightning (NVFP4) (263 t/s), Inkling Small (231 t/s), and NVIDIA Nemotron Nano 9B V2 (222 t/s).
  • For latency, Nemotron 3 Nano (non-reasoning) (0.53s), NVIDIA Nemotron Nano 9B V2 (non-reasoning) (0.56s), and Qwen3.5 35B A3B (non-reasoning) FP8 (0.58s) offer the lowest time to first answer token.
  • For pricing, Llama 3.1 8B (Turbo, FP8) ($0.02), Llama 3.1 8B ($0.02), and Granite 4.2 3B ($0.02) offer the lowest blended prices per 1M tokens.
  • For context window size, GLM-5.2 (max) (FP4) (1M), DeepSeek V4 Pro (max) (FP4) (1M), and DeepSeek V4 Flash (high) (FP4) (1M) support the largest context windows on DeepInfra.
Artificial Analysis Intelligence Index · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Intelligence Evaluations

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 incorporates 10 evaluations: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better
See more

Agentic knowledge work, (Elo-500)/2000

Agentic real-world work tasks, (Elo-500)/2000

Agentic SaaS workflows

Agentic coding & terminal use

SciCodeUnder review

Coding

Reasoning & knowledge

Professional document reasoning, All-pass

CritPtUnder review

Physics reasoning

Long context reasoning

Legal agentic work, Hallucination-Gated All-Pass Rate

Agentic business operations

Agentic scientific research workflows in a terminal

Quantitative analysis on spreadsheets & documents

Kubernetes incident root-cause analysis

Visual reasoning

Medical long context reasoning

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Context Window

Context Window

Context window: tokens limit · Higher is better

Pricing

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Performance Summary

Output Speed vs. Price

Output speed: output tokens per second · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Speed

Measured by Output Speed (tokens per second)

Output Speed

Output tokens per second · Higher is better

Latency

Measured by Time (seconds) to First Token

Latency: Time To First Answer Token

Seconds to first answer token received · Accounts for reasoning model 'thinking' time

Cache Behaviour

Cache Hit Rate

Share of cacheable input tokens served from cache · Median of the last four weeks, updated Sep 26, 2026

Cost per Task vs. Cache Hit Rate

Weighted average cost (USD) per Intelligence Index task · Cache hit rate: median of the last four weeks, updated Sep 26, 2026
Most attractive quadrant
Pareto line

End-to-End Response Time

Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed

End-to-End Response Time vs. Price

End-to-end response time: end-to-end seconds to output 500 tokens · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Further Analysis
Xiaomi logo
MiMo-V2.6-Pro
1M
Open
46
$0.96
33
1.27
77.82
61.24
Z AI logo
GLM-5.3 (max)
1.05M
Open
45
$0.97
78
1.34
33.40
25.65
Z AI logo
GLM-5.3-Flash
1M
Open
42
$0.34
27
1.43
92.69
73.01
Alibaba logo
Qwen3.8 2.4T A95B
262k
Open
40
$2.89
112
1.22
23.61
17.91
DeepSeek logo
DeepSeek V4.1 Flash (max)
1M
Open
39
$0.44
70
0.80
36.45
28.52
Xiaomi logo
MiMo-V2.6-Flash
1M
Open
38
$0.42
31
1.42
81.24
63.86
DeepSeek logo
DeepSeek V4 Pro 0813 (max)
1M
Open
36
$1.00
42
1.44
61.30
47.89
DeepSeek logo
DeepSeek V4 Flash Vision (max)
1M
Proprietary
35
$0.51
134
0.98
19.66
14.95
DeepSeek logo
DeepSeek V4 Flash 0731 (max)
1M
Open
34
$0.09
42
1.00
59.90
47.11
Z AI logo
GLM-5.2 (max) (FP4)
1.05M
Open
34
$0.37
62
1.26
41.31
32.04
Alibaba logo
Qwen3.8 27B (xhigh)
262k
Open
34
$0.52
53
0.92
47.70
37.42
DeepSeek logo
DeepSeek V4 Pro (max) (FP4)
1.05M
Open
30
$1.19
65
1.32
75.97
67.00
DeepSeek logo
DeepSeek V4 Pro (high) (FP4)
65.5k
Open
30*
--
51
1.28
49.70
38.71
MiniMax logo
MiniMax-M3
524k
Open
29
$0.44
23
1.16
107.79
85.30
Z AI logo
GLM-5 (FP4)
203k
Open
28*
--
63
1.36
59.02
49.66
Kimi logo
Kimi K2.6 (FP4)
262k
Open
27
$0.51
18
1.42
279.27
249.79
Z AI logo
GLM-5.1 (FP4)
203k
Open
26
$0.58
71
1.17
61.23
53.07
Xiaomi logo
MiMo-V2.5-Pro
65.5k
Open
26
$0.28
35
1.53
72.64
56.89
Kimi logo
Kimi K2.7 Code
262k
Open
26
$0.39
53
1.26
53.00
42.27
Thinking Machines logo
Inkling Small
524k
Open
26
--
135
0.85
19.31
14.77
Tencent logo
Hy3 (FP8)
262k
Open
25
$0.07
55
1.03
46.21
36.14
Xiaomi logo
MiMo-V2.5
262k
Open
25*
--
36
1.25
69.88
54.91
Thinking Machines logo
Inkling (xhigh) (FP8)
131k
Open
25
--
110
0.74
23.45
18.17
DeepSeek logo
DeepSeek V4 Flash (high) (FP4)
1.05M
Open
24
$0.08
28
1.27
64.34
44.94
Z AI logo
GLM-5.1 (non-reasoning) (FP4)
203k
Open
24*
--
89
1.12
6.74
--
DeepSeek logo
DeepSeek V4 Flash (max) (FP4)
1.05M
Open
24
$0.07
28
1.75
222.39
202.59
Kimi logo
Kimi K2.6 (non-reasoning) (FP4)
262k
Open
24*
--
15
1.59
35.18
--
Kimi logo
Kimi K2.5
262k
Open
23*
--
19
1.46
185.51
157.51
NVIDIA logo
Nemotron 3 Ultra
262k
Open
23
$0.39
32
1.71
89.36
71.86
NVIDIA logo
Nemotron 3 Ultra BF16
262k
Open
23
$0.99
42
1.64
67.80
54.24
Alibaba logo
Qwen3.5 27B (FP8)
262k
Open
23*
--
56
1.22
45.90
35.74
MiniMax logo
MiniMax-M2.5 (FP8)
197k
Open
23*
--
22
1.23
115.08
91.08
Z AI logo
GLM-4.7 (FP4)
203k
Open
22*
--
18
1.16
137.40
109.00
Z AI logo
GLM-5 (non-reasoning) (FP8)
203k
Open
22*
--
70
1.12
8.31
--
DeepSeek logo
DeepSeek V3.2 (FP4)
164k
Open
21*
--
20
1.55
126.17
99.69
Alibaba logo
Qwen3.5 397B A17B (non-reasoning) (FP8)
262k
Open
21*
--
28
1.30
18.86
--
Alibaba logo
Qwen3.6 27B FP8
262k
Open
21
$0.37
52
1.03
120.86
110.13
InclusionAI logo
Ling 3.0 Flash
131k
Open
20
$0.02
44
0.64
57.71
45.65
Alibaba logo
Qwen3.6 27B (non-reasoning) FP8
262k
Open
20*
--
49
1.14
11.33
--
StepFun logo
Step 3.7 Flash
256k
Open
19*
--
39
1.47
65.59
51.30
Alibaba logo
Qwen3.5 27B (non-reasoning) FP8
262k
Open
19*
--
49
1.24
11.51
--
Alibaba logo
Qwen3.5 35B A3B (FP8)
262k
Open
19*
--
65
0.60
38.87
30.62
Z AI logo
GLM-4.6 (FP4)
203k
Open
19*
--
23
1.58
110.75
87.34
Alibaba logo
Qwen3.5 397B A17B (FP8)
262k
Open
18
--
35
1.27
107.73
92.02
Xiaomi logo
MiMo-V2.5-Pro (non-reasoning)
65.5k
Open
18*
--
30
1.32
17.88
--
Alibaba logo
Qwen3.6 35B A3B (FP8)
262k
Open
18
$0.14
38
0.94
158.12
143.85
Alibaba logo
Qwen3.5 122B A10B (non-reasoning) (FP4)
262k
Open
18*
--
30
1.49
18.30
--
Meta logo
Muse Glimmer (high)
131k
Open
17
$0.05
75
1.41
34.55
26.51
Z AI logo
GLM-4.7 (non-reasoning) (FP4)
203k
Open
17*
--
19
1.44
27.45
--
Google logo
Gemma 4 26B A4B (FP8)
262k
Open
17*
--
42
0.84
60.62
47.82
DeepSeek logo
DeepSeek V3.2 (non-reasoning)
164k
Open
16*
--
20
1.51
26.22
--
Alibaba logo
Qwen3.5 122B A10B (FP4)
262k
Open
16
$0.24
28
1.44
91.94
72.40
Alibaba logo
Qwen3.6 35B A3B (non-reasoning) (FP8)
262k
Open
15*
--
80
0.81
7.08
--
Alibaba logo
Qwen3.5 35B A3B (non-reasoning) FP8
262k
Open
15*
--
75
0.60
7.24
--
Z AI logo
GLM-4.7-Flash
203k
Open
15*
--
26
1.52
97.97
77.16
Google logo
Gemma 4 31B
262k
Open
15
$0.15
20
2.57
112.18
85.10
DeepSeek logo
DeepSeek V3.1 Terminus (non-reasoning) (FP4)
164k
Open
14*
--
39
0.92
13.84
--
Google logo
Gemma 4 31B (non-reasoning) (FP8)
262k
Open
14*
--
18
2.26
29.91
--
DeepSeek logo
DeepSeek V3.1 (non-reasoning) (FP4)
164k
Open
14*
--
8
2.65
66.15
--
Google logo
Gemma 4 26B A4B (non-reasoning) (FP8)
262k
Open
13*
--
44
0.69
12.13
--
Alibaba logo
Qwen3.5 4B (FP8)
262k
Open
13*
--
23
0.86
110.73
87.89
DeepSeek logo
DeepSeek R1 0528
164k
Open
13*
--
26
0.86
95.39
75.63
NVIDIA logo
Nemotron 3.5 Lightning (NVFP4)
262k
Open
13
$0.09
307
0.54
8.68
6.51
NVIDIA logo
Nemotron 3 Super
262k
Open
13
$0.48
54
15.04
61.65
37.29
Alibaba logo
Qwen3 235B A22B 2507 (FP8)
262k
Open
13
--
89
0.80
29.03
22.58
IBM logo
Granite 4.2 30B
131k
Open
13
$0.07
76
0.96
33.92
26.37
Alibaba logo
Qwen3 235B 2507 (FP8)
262k
Open
12*
--
11
1.47
46.22
--
Alibaba logo
Qwen3 Coder 480B (Turbo, FP4)
262k
Open
12*
--
64
1.52
9.34
--
OpenAI logo
gpt-oss-120b (high) (Turbo)
131k
Open
12
$0.11
191
0.89
13.97
10.46
OpenAI logo
gpt-oss-120b (high)
131k
Open
12
$0.03
43
0.68
59.38
46.96
IBM logo
Granite 4.2 8B
131k
Open
11
$0.02
52
0.75
48.92
38.54
Alibaba logo
Qwen3.5 4B (non-reasoning) FP8
262k
Open
11*
--
25
0.84
20.58
--
OpenAI logo
gpt-oss-120b (low)
131k
Open
10*
--
42
0.69
59.58
47.11
Meta logo
Llama 4 Maverick (FP8)
1.05M
Open
10*
--
25
0.84
20.68
--
DeepSeek logo
DeepSeek V3 0324 (FP4)
164k
Open
10
$0.02
79
0.84
7.21
--
Alibaba logo
Qwen3 Next 80B A3B
262k
Open
10*
--
130
0.80
4.66
--
IBM logo
Granite 4.2 3B
131k
Open
9
$0.01
215
0.53
12.14
9.29
OpenAI logo
gpt-oss-20b (high)
131k
Open
9
$0.01
111
0.52
23.09
18.05
Google logo
Gemma 4 E4B
131k
Open
9*
--
28
1.09
90.91
71.86
NVIDIA logo
Nemotron 3 Nano
262k
Open
9
$0.02
19
66.66
198.96
105.84
Alibaba logo
Qwen3 32B (FP8)
41k
Open
9*
--
29
1.57
88.73
69.72
DeepSeek logo
DeepSeek V3 (Dec)
164k
Open
8
$0.02
20
3.36
28.25
--
Mistral logo
Mistral Small 3.2 (FP8)
128k
Open
8*
--
38
0.88
14.12
--
Alibaba logo
Qwen3 14B (FP8)
32.8k
Open
8*
--
20
1.71
125.96
99.40
Meta logo
Llama 4 Scout
131k
Open
8*
--
26
0.79
19.79
--
DeepSeek logo
DeepSeek R1 Distill Llama 70B
131k
Open
8*
--
--
--
--
--
Alibaba logo
Qwen2.5 72B
32.8k
Open
8*
--
23
2.35
23.87
--
Meta logo
Llama 3.3 70B (Turbo, FP8)
131k
Open
8*
--
17
2.30
31.81
--
Alibaba logo
Qwen3 30B (FP8)
41k
Open
8*
--
128
0.57
20.11
15.63
Google logo
Gemma 4 E4B (non-reasoning)
131k
Open
7*
--
28
0.78
18.63
--
NVIDIA logo
NVIDIA Nemotron Nano 9B V2
131k
Open
7*
--
18
71.66
209.85
110.56
Alibaba logo
Qwen3 32B (non-reasoning) (FP8)
41k
Open
7*
--
29
1.45
18.88
--
Mistral logo
Mistral Small 3.1
128k
Open
7
$0.02
37
0.94
14.56
--
Meta logo
Llama 3.1 8B (Turbo, FP8)
131k
Open
7*
--
33
0.98
16.28
--
Meta logo
Llama 3.1 8B
131k
Open
7*
--
34
1.13
16.04
--
NVIDIA logo
Nemotron 3 Nano (non-reasoning)
262k
Open
7*
--
21
19.31
42.96
--
NVIDIA logo
NVIDIA Nemotron Nano 9B V2 (non-reasoning)
131k
Open
7*
--
21
57.88
82.22
--
Alibaba logo
Qwen3 14B (non-reasoning) (FP8)
41k
Open
7*
--
30
1.76
18.66
--
Mistral logo
Mistral Small 3
32.8k
Open
7*
--
51
0.87
10.59
--
Alibaba logo
Qwen3 30B (non-reasoning) (FP8)
41k
Open
7*
--
115
0.52
4.86
--
Meta logo
Llama 3.1 70B
131k
Open
7*
--
39
1.82
14.49
--
Meta logo
Llama 3.1 70B (Turbo, FP8)
131k
Open
7*
--
42
1.89
13.85
--
Nous Research logo
Hermes 3 - Llama-3.1 70B
131k
Open
6*
--
31
2.12
18.38
--
Microsoft logo
Phi-4
16.4k
Open
6*
--
71
0.96
7.98
--
Meta logo
Llama 3.2 11B (Vision)
131k
Open
5*
--
15
1.96
35.01
--
Google logo
Gemma 3 27B
131k
Open
5
$0.16
16
1.89
32.89
--
Google logo
Gemma 3 4B
131k
Open
5*
--
25
1.11
21.00
--
Meta logo
Llama 3 8B
8.19k
Open
5*
--
--
--
--
--
Google logo
Gemma 3 12B
131k
Open
4
$0.13
62
1.09
9.22
--

Key definitions

Frequently Asked Questions

Common questions about DeepInfra