DeepInfra: Intelligenz, Leistung und Preise der Modelle

DeepInfra
DeepInfra

Diese Analyse soll Sie bei der Auswahl des besten von DeepInfra angebotenen Modells für Ihren Anwendungsfall unterstützen.

Höchste Intelligenz

#1
MiMo-V2.6-ProMiMo-V2.6-Pro
46
#2
GLM-5.3 (max)GLM-5.3 (max)
45
#3
GLM-5.3-FlashGLM-5.3-Flash
42
#4
Qwen3.8 2.4T A95BQwen3.8 2.4T A95B
40
#5
DeepSeek V4.1 Flash (max)DeepSeek V4.1 Flash (max)
39

Intelligence Index

Insgesamt 107 Modelle

Am schnellsten

#1
Nemotron 3.5 Lightning (NVFP4)Nemotron 3.5 Lightning (NVFP4)
294 t/s
#2
gpt-oss-120b (high) (Turbo)gpt-oss-120b (high) (Turbo)
224 t/s
#3
Granite 4.2 3BGranite 4.2 3B
215 t/s
#4
Qwen3 Next 80B A3BQwen3 Next 80B A3B
168 t/s
#5
Qwen3.6 35B A3B (FP8)Qwen3.6 35B A3B (FP8)
150 t/s

Ausgabegeschwindigkeit

Insgesamt 107 Modelle

Niedrigster Preis

#1
Llama 3.1 8B (Turbo, FP8)Llama 3.1 8B (Turbo, FP8)
$0.02
#2
Llama 3.1 8BLlama 3.1 8B
$0.02
#3
Granite 4.2 3BGranite 4.2 3B
$0.02
#4
Gemma 4 E4BGemma 4 E4B
$0.03
#5
Gemma 4 E4B (non-reasoning)Gemma 4 E4B (non-reasoning)
$0.03

Mischpreis (pro 1 Mio. Tokens)

Insgesamt 107 Modelle

DeepInfra bietet 107 Modelle mit jeweils unterschiedlichen Merkmalen bei Intelligenz, Leistung und Preis an. Nachfolgend werden die wichtigsten Metriken der Modelle verglichen.

  • Bei der Intelligenz sind MiMo-V2.6-Pro (46), GLM-5.3 (max) (45) und GLM-5.3-Flash (42) die führenden Modelle von DeepInfra.
  • Bei der Ausgabegeschwindigkeit sind Nemotron 3.5 Lightning (NVFP4) (294 t/s), gpt-oss-120b (high) (Turbo) (224 t/s) und Granite 4.2 3B (215 t/s) am schnellsten. Die Geschwindigkeit unterscheidet sich deutlich zwischen den Modellen; der Unterschied zwischen dem schnellsten und dem langsamsten beträgt 95 %.
  • Bei der Latenz bieten Qwen3 30B (non-reasoning) (FP8) (0.59 s), Qwen3.5 35B A3B (non-reasoning) FP8 (0.70 s) und Qwen3 Next 80B A3B (0.73 s) die kürzeste Zeit bis zum ersten Antworttoken.
  • Beim Preis bieten Llama 3.1 8B (Turbo, FP8) ($0.02), Llama 3.1 8B ($0.02) und Granite 4.2 3B ($0.02) die niedrigsten Mischpreise pro 1 Mio. Tokens.
  • Bei der Größe des Kontextfensters unterstützen GLM-5.2 (max) (FP4) (1M), DeepSeek V4 Pro (max) (FP4) (1M) und DeepSeek V4 Flash (high) (FP4) (1M) die größten Kontextfenster von DeepInfra.
Artificial Analysis Intelligence Index · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Intelligenzevaluationen

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 incorporates 10 evaluations: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better
Mehr anzeigen

Agentic knowledge work, (Elo-500)/2000

Agentic real-world work tasks, (Elo-500)/2000

Agentic SaaS workflows

Agentic coding & terminal use

SciCodeUnder review

Coding

Reasoning & knowledge

Professional document reasoning, All-pass

CritPtUnder review

Physics reasoning

Long context reasoning

Legal agentic work, criterion pass rate

Agentic business operations

Agentic scientific research workflows in a terminal

Quantitative analysis on spreadsheets & documents

Kubernetes incident root-cause analysis

Visual reasoning

Medical long context reasoning

Intelligence Index vs. Preis

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Kontextfenster

Kontextfenster

Context window: tokens limit · Higher is better

Preise

Intelligence Index vs. Preis

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Leistungsübersicht

Ausgabegeschwindigkeit vs. Preis

Output speed: output tokens per second · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Geschwindigkeit

Gemessen anhand der Ausgabegeschwindigkeit (Tokens pro Sekunde)

Ausgabegeschwindigkeit

Output tokens per second · Higher is better

Latenz

Gemessen anhand der Zeit (Sekunden) bis zum ersten Token

Latenz: Zeit bis zum ersten Antworttoken

Sekunden bis zum ersten Antwort-Token · Berücksichtigt die „Denkzeit“ von Reasoning-Modellen

Cache-Verhalten

Cache-Trefferquote

Anteil der cachefähigen Eingabe-Token aus dem Cache · Median der letzten vier Wochen, aktualisiert am 26. Sept. 2026

Kosten pro Aufgabe vs. Cache-Trefferquote

Weighted average cost (USD) per Intelligence Index task · Cache hit rate: median of the last four weeks, updated Sep 26, 2026
Most attractive quadrant
Pareto line

Ende-zu-Ende-Antwortzeit

Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed

Ende-zu-Ende-Antwortzeit vs. Preis

End-to-end response time: end-to-end seconds to output 500 tokens · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Weitere Analyse
Logo von Xiaomi
MiMo-V2.6-Pro
1M
Offen
46
$0.96
29
1.78
89.49
70.16
Logo von Z AI
GLM-5.3 (max)
1.05M
Offen
45
$0.97
55
1.21
46.36
36.12
Logo von Z AI
GLM-5.3-Flash
1M
Offen
42
$0.34
39
1.17
65.38
51.37
Logo von Alibaba
Qwen3.8 2.4T A95B
262k
Offen
40
$2.89
102
1.20
25.61
19.52
Logo von DeepSeek
DeepSeek V4.1 Flash (max)
1M
Offen
39
$0.44
96
0.79
26.77
20.78
Logo von Xiaomi
MiMo-V2.6-Flash
1M
Offen
38
$0.42
54
1.31
47.73
37.13
Logo von DeepSeek
DeepSeek V4 Pro 0813 (max)
1M
Offen
36
$1.00
52
1.10
49.17
38.45
Logo von DeepSeek
DeepSeek V4 Flash Vision (max)
1M
Proprietär
35
$0.51
135
0.93
19.52
14.87
Logo von DeepSeek
DeepSeek V4 Flash 0731 (max)
1M
Offen
34
$0.09
50
0.84
50.80
39.97
Logo von Z AI
GLM-5.2 (max) (FP4)
1.05M
Offen
34
$0.37
75
1.23
34.46
26.58
Logo von Alibaba
Qwen3.8 27B (xhigh)
262k
Offen
34
$0.52
36
1.07
71.46
56.31
Logo von DeepSeek
DeepSeek V4 Pro (max) (FP4)
1.05M
Offen
30
$1.19
69
1.07
71.46
63.17
Logo von DeepSeek
DeepSeek V4 Pro (high) (FP4)
65.5k
Offen
30*
--
71
1.31
36.57
28.18
Logo von MiniMax
MiniMax-M3
524k
Offen
29
$0.44
23
0.97
107.83
85.48
Logo von Z AI
GLM-5 (FP4)
203k
Offen
28*
--
72
1.28
51.44
43.20
Logo von Kimi
Kimi K2.6 (FP4)
262k
Offen
27
$0.51
22
1.41
226.05
201.96
Logo von Z AI
GLM-5.1 (FP4)
203k
Offen
26
$0.58
61
1.76
71.61
61.71
Logo von Xiaomi
MiMo-V2.5-Pro
65.5k
Offen
26
$0.28
34
1.46
74.28
58.25
Logo von Kimi
Kimi K2.7 Code
262k
Offen
26
$0.39
49
1.29
57.26
45.72
Logo von Thinking Machines
Inkling Small
524k
Offen
26
--
120
0.91
21.73
16.66
Logo von Tencent
Hy3 (FP8)
262k
Offen
25
$0.07
44
1.02
57.73
45.37
Logo von Xiaomi
MiMo-V2.5
262k
Offen
25*
--
45
1.35
56.62
44.21
Logo von Thinking Machines
Inkling (xhigh) (FP8)
131k
Offen
25
--
100
0.63
25.67
20.04
Logo von DeepSeek
DeepSeek V4 Flash (high) (FP4)
1.05M
Offen
24
$0.08
32
1.80
56.55
39.01
Logo von Z AI
GLM-5.1 (non-reasoning) (FP4)
203k
Offen
24*
--
60
1.35
9.69
--
Logo von DeepSeek
DeepSeek V4 Flash (max) (FP4)
1.05M
Offen
24
$0.07
32
1.70
195.18
177.66
Logo von Kimi
Kimi K2.6 (non-reasoning) (FP4)
262k
Offen
24*
--
19
1.52
28.32
--
Logo von Kimi
Kimi K2.5
262k
Offen
23*
--
33
1.54
106.68
89.98
Logo von NVIDIA
Nemotron 3 Ultra
262k
Offen
23
$0.39
71
1.56
40.56
31.98
Logo von NVIDIA
Nemotron 3 Ultra BF16
262k
Offen
23
$0.99
65
1.64
44.04
34.75
Logo von Alibaba
Qwen3.5 27B (FP8)
262k
Offen
23*
--
59
1.20
43.75
34.05
Logo von MiniMax
MiniMax-M2.5 (FP8)
197k
Offen
23*
--
24
1.11
106.78
84.53
Logo von Z AI
GLM-4.7 (FP4)
203k
Offen
22*
--
14
2.06
181.62
143.65
Logo von Z AI
GLM-5 (non-reasoning) (FP8)
203k
Offen
22*
--
78
1.16
7.56
--
Logo von DeepSeek
DeepSeek V3.2 (FP4)
164k
Offen
21*
--
21
1.57
121.29
95.78
Logo von Alibaba
Qwen3.5 397B A17B (non-reasoning) (FP8)
262k
Offen
21*
--
45
1.16
12.16
--
Logo von Alibaba
Qwen3.6 27B FP8
262k
Offen
21
$0.37
59
1.00
105.62
96.15
Logo von InclusionAI
Ling 3.0 Flash
131k
Offen
20
$0.02
56
0.70
45.66
35.97
Logo von Alibaba
Qwen3.6 27B (non-reasoning) FP8
262k
Offen
20*
--
53
1.18
10.54
--
Logo von StepFun
Step 3.7 Flash
256k
Offen
19*
--
38
1.16
66.71
52.44
Logo von Alibaba
Qwen3.5 27B (non-reasoning) FP8
262k
Offen
19*
--
66
1.10
8.63
--
Logo von Alibaba
Qwen3.5 35B A3B (FP8)
262k
Offen
19*
--
122
0.59
21.05
16.37
Logo von Z AI
GLM-4.6 (FP4)
203k
Offen
19*
--
23
1.61
108.00
85.11
Logo von Alibaba
Qwen3.5 397B A17B (FP8)
262k
Offen
18
--
44
1.07
84.22
71.87
Logo von Xiaomi
MiMo-V2.5-Pro (non-reasoning)
65.5k
Offen
18*
--
21
1.37
24.78
--
Logo von Alibaba
Qwen3.6 35B A3B (FP8)
262k
Offen
18
$0.14
155
0.78
38.77
34.77
Logo von Alibaba
Qwen3.5 122B A10B (non-reasoning) (FP4)
262k
Offen
18*
--
39
1.30
14.15
--
Logo von Meta
Muse Glimmer (high)
131k
Offen
17
$0.05
79
3.00
34.67
25.33
Logo von Z AI
GLM-4.7 (non-reasoning) (FP4)
203k
Offen
17*
--
14
1.87
37.03
--
Logo von Google
Gemma 4 26B A4B (FP8)
262k
Offen
17*
--
28
0.83
90.32
71.59
Logo von DeepSeek
DeepSeek V3.2 (non-reasoning)
164k
Offen
16*
--
26
1.45
20.72
--
Logo von Alibaba
Qwen3.5 122B A10B (FP4)
262k
Offen
16
$0.24
44
1.13
57.66
45.22
Logo von Alibaba
Qwen3.6 35B A3B (non-reasoning) (FP8)
262k
Offen
15*
--
150
0.75
4.09
--
Logo von Alibaba
Qwen3.5 35B A3B (non-reasoning) FP8
262k
Offen
15*
--
110
0.70
5.26
--
Logo von Z AI
GLM-4.7-Flash
203k
Offen
15*
--
26
1.31
96.49
76.14
Logo von IBM
Granite 4.2 30B
131k
Offen
15*
--
75
0.86
34.18
26.65
Logo von Google
Gemma 4 31B
262k
Offen
15
$0.15
14
2.37
159.41
121.92
Logo von DeepSeek
DeepSeek V3.1 Terminus (non-reasoning) (FP4)
164k
Offen
14*
--
52
0.94
10.61
--
Logo von Google
Gemma 4 31B (non-reasoning) (FP8)
262k
Offen
14*
--
13
2.24
40.98
--
Logo von DeepSeek
DeepSeek V3.1 (non-reasoning) (FP4)
164k
Offen
14*
--
8
2.54
64.36
--
Logo von Google
Gemma 4 26B A4B (non-reasoning) (FP8)
262k
Offen
13*
--
23
0.80
22.62
--
Logo von Alibaba
Qwen3.5 4B (FP8)
262k
Offen
13*
--
18
0.84
142.92
113.66
Logo von DeepSeek
DeepSeek R1 0528
164k
Offen
13*
--
26
0.93
98.00
77.65
Logo von NVIDIA
Nemotron 3.5 Lightning (NVFP4)
262k
Offen
13
$0.09
294
0.49
8.99
6.80
Logo von NVIDIA
Nemotron 3 Super
262k
Offen
13
$0.48
72
14.60
49.56
27.97
Logo von Alibaba
Qwen3 235B A22B 2507 (FP8)
262k
Offen
13
--
148
0.79
17.66
13.49
Logo von Alibaba
Qwen3 235B 2507 (FP8)
262k
Offen
12*
--
12
3.21
46.34
--
Logo von Alibaba
Qwen3 Coder 480B (Turbo, FP4)
262k
Offen
12*
--
108
0.72
5.35
--
Logo von OpenAI
gpt-oss-120b (high) (Turbo)
131k
Offen
12
$0.11
210
0.88
12.77
9.51
Logo von OpenAI
gpt-oss-120b (high)
131k
Offen
12
$0.03
58
0.61
43.48
34.30
Logo von IBM
Granite 4.2 8B
131k
Offen
11
$0.02
47
0.89
54.33
42.75
Logo von Alibaba
Qwen3.5 4B (non-reasoning) FP8
262k
Offen
11*
--
18
0.88
27.95
--
Logo von OpenAI
gpt-oss-120b (low)
131k
Offen
10*
--
60
0.59
42.08
33.19
Logo von Meta
Llama 4 Maverick (FP8)
1.05M
Offen
10*
--
30
0.87
17.48
--
Logo von DeepSeek
DeepSeek V3 0324 (FP4)
164k
Offen
10
$0.02
115
0.75
5.10
--
Logo von Alibaba
Qwen3 Next 80B A3B
262k
Offen
10*
--
153
0.73
4.00
--
Logo von IBM
Granite 4.2 3B
131k
Offen
9
$0.01
215
0.53
12.17
9.31
Logo von OpenAI
gpt-oss-20b (high)
131k
Offen
9
$0.01
109
0.53
23.56
18.42
Logo von Google
Gemma 4 E4B
131k
Offen
9*
--
33
1.19
75.99
59.84
Logo von NVIDIA
Nemotron 3 Nano
262k
Offen
9
$0.02
19
73.43
208.26
107.87
Logo von Alibaba
Qwen3 32B (FP8)
41k
Offen
9*
--
25
1.49
103.06
81.26
Logo von DeepSeek
DeepSeek V3 (Dec)
164k
Offen
8
$0.02
19
1.67
27.95
--
Logo von Mistral
Mistral Small 3.2 (FP8)
128k
Offen
8*
--
38
1.06
14.20
--
Logo von Alibaba
Qwen3 14B (FP8)
32.8k
Offen
8*
--
31
1.09
82.92
65.46
Logo von Meta
Llama 4 Scout
131k
Offen
8*
--
27
0.88
19.21
--
Logo von DeepSeek
DeepSeek R1 Distill Llama 70B
131k
Offen
8*
--
--
--
--
--
Logo von Alibaba
Qwen2.5 72B
32.8k
Offen
8*
--
26
2.46
21.46
--
Logo von Meta
Llama 3.3 70B (Turbo, FP8)
131k
Offen
8*
--
14
2.00
37.55
--
Logo von Alibaba
Qwen3 30B (FP8)
41k
Offen
8*
--
144
0.57
17.90
13.86
Logo von Google
Gemma 4 E4B (non-reasoning)
131k
Offen
7*
--
30
0.85
17.77
--
Logo von NVIDIA
NVIDIA Nemotron Nano 9B V2
131k
Offen
7*
--
18
66.35
207.70
113.08
Logo von Alibaba
Qwen3 32B (non-reasoning) (FP8)
41k
Offen
7*
--
25
1.40
21.13
--
Logo von Mistral
Mistral Small 3.1
128k
Offen
7
$0.02
36
1.10
14.92
--
Logo von Meta
Llama 3.1 8B (Turbo, FP8)
131k
Offen
7*
--
32
1.08
16.55
--
Logo von Meta
Llama 3.1 8B
131k
Offen
7*
--
31
0.89
17.10
--
Logo von NVIDIA
Nemotron 3 Nano (non-reasoning)
262k
Offen
7*
--
21
12.16
36.01
--
Logo von NVIDIA
NVIDIA Nemotron Nano 9B V2 (non-reasoning)
131k
Offen
7*
--
21
47.68
71.63
--
Logo von Alibaba
Qwen3 14B (non-reasoning) (FP8)
41k
Offen
7*
--
29
1.07
18.09
--
Logo von Mistral
Mistral Small 3
32.8k
Offen
7*
--
48
0.94
11.42
--
Logo von Alibaba
Qwen3 30B (non-reasoning) (FP8)
41k
Offen
7*
--
128
0.55
4.47
--
Logo von Meta
Llama 3.1 70B
131k
Offen
7*
--
41
1.78
13.92
--
Logo von Meta
Llama 3.1 70B (Turbo, FP8)
131k
Offen
7*
--
40
1.93
14.34
--
Logo von Nous Research
Hermes 3 - Llama-3.1 70B
131k
Offen
6*
--
31
2.10
18.19
--
Logo von Microsoft
Phi-4
16.4k
Offen
6*
--
75
0.97
7.68
--
Logo von Meta
Llama 3.2 11B (Vision)
131k
Offen
5*
--
15
1.99
35.16
--
Logo von Google
Gemma 3 27B
131k
Offen
5
$0.16
17
1.31
30.05
--
Logo von Google
Gemma 3 4B
131k
Offen
5*
--
37
1.00
14.53
--
Logo von Meta
Llama 3 8B
8.19k
Offen
5*
--
--
--
--
--
Logo von Google
Gemma 3 12B
131k
Offen
4
$0.13
35
1.18
15.29
--

Wichtige Definitionen

Häufig gestellte Fragen

Häufige Fragen zu DeepInfra