DeepInfra: Intelligenz, Leistung und Preise der Modelle

DeepInfra
DeepInfra

Diese Analyse soll Sie bei der Auswahl des besten von DeepInfra angebotenen Modells für Ihren Anwendungsfall unterstützen.

Höchste Intelligenz

Updated
#1
GLM-5.3 (max)GLM-5.3 (max)
45
#2
GLM-5.3-FlashGLM-5.3-Flash
42
#3
Qwen3.8 2.4T A95BQwen3.8 2.4T A95B
40
#4
DeepSeek V4 Pro 0813 (max)DeepSeek V4 Pro 0813 (max)
36
#5
DeepSeek V4 Flash 0731 (max)DeepSeek V4 Flash 0731 (max)
35

Intelligence Index

Insgesamt 108 Modelle

Am schnellsten

#1
Inkling SmallInkling Small
250 t/s
#2
gpt-oss-120b (high) (Turbo)gpt-oss-120b (high) (Turbo)
230 t/s
#3
Granite 4.2 3BGranite 4.2 3B
214 t/s
#4
Inkling (FP8)Inkling (FP8)
210 t/s
#5
Step 3.7 FlashStep 3.7 Flash
168 t/s

Ausgabegeschwindigkeit

Insgesamt 108 Modelle

Niedrigster Preis

#1
Llama 3.1 8B (Turbo, FP8)Llama 3.1 8B (Turbo, FP8)
$0.02
#2
Llama 3.1 8BLlama 3.1 8B
$0.02
#3
Granite 4.2 3BGranite 4.2 3B
$0.02
#4
Gemma 4 E4BGemma 4 E4B
$0.03
#5
Gemma 4 E4B (Non-reasoning)Gemma 4 E4B (Non-reasoning)
$0.03

Mischpreis (pro 1 Mio. Tokens)

Insgesamt 108 Modelle

DeepInfra bietet 108 Modelle mit jeweils unterschiedlichen Merkmalen bei Intelligenz, Leistung und Preis an. Nachfolgend werden die wichtigsten Metriken der Modelle verglichen.

  • Bei der Intelligenz sind GLM-5.3 (max) (45), GLM-5.3-Flash (42) und Qwen3.8 2.4T A95B (40) die führenden Modelle von DeepInfra.
  • Bei der Ausgabegeschwindigkeit sind Inkling Small (250 t/s), gpt-oss-120b (high) (Turbo) (230 t/s) und Granite 4.2 3B (214 t/s) am schnellsten.
  • Bei der Latenz bieten Qwen3 30B (Non-reasoning) (FP8) (0.50 s), Llama 4 Maverick (FP8) (0.51 s) und Qwen3 Coder 480B (Turbo, FP4) (0.65 s) die kürzeste Zeit bis zum ersten Antworttoken.
  • Beim Preis bieten Llama 3.1 8B (Turbo, FP8) ($0.02), Llama 3.1 8B ($0.02) und Granite 4.2 3B ($0.02) die niedrigsten Mischpreise pro 1 Mio. Tokens.
  • Bei der Größe des Kontextfensters unterstützen GLM-5.2 (max) (FP4) (1M), DeepSeek V4 Pro (max) (FP4) (1M) und DeepSeek V4 Flash (high) (FP4) (1M) die größten Kontextfenster von DeepInfra.

Wichtigste Ergebnisse

Updated
Artificial Analysis Intelligence Index · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Intelligenzevaluationen

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3 incorporates 10 evaluations: AA-Briefcase, GDPval-AA v2, AutomationBench-AA, Terminal-Bench v4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
Estimate (independent evaluation forthcoming)

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better
See more

Agentic knowledge work, (Elo-500)/2000

Agentic real-world work tasks, (Elo-500)/2000

Agentic SaaS workflows

Agentic coding & terminal use

Coding

Reasoning & knowledge

Professional document reasoning, All-pass

Physics reasoning

Long context reasoning

Legal agentic work, criterion pass rate

Agentic business operations

Quantitative analysis on spreadsheets & documents

Instruction following

Agentic tool use

Long-horizon agentic tasks

Kubernetes incident root-cause analysis

Visual reasoning

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Kontextfenster

Context Window

Context window: tokens limit · Higher is better

Preise

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Leistungsübersicht

Output Speed vs. Price

Output speed: output tokens per second · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Geschwindigkeit

Gemessen anhand der Ausgabegeschwindigkeit (Tokens pro Sekunde)

Output Speed

Output tokens per second · Higher is better

Latenz

Gemessen anhand der Zeit (Sekunden) bis zum ersten Token

Latency: Time To First Answer Token

Seconds to first answer token received · Accounts for reasoning model 'thinking' time

Ende-zu-Ende-Antwortzeit

Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed

End-to-End Response Time vs. Price

End-to-end response time: end-to-end seconds to output 500 tokens · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Weitere Analyse
Logo von Z AI
GLM-5.3 (max)
1.05M
Offen
45
$2.16
136
1.03
19.47
14.75
Logo von Z AI
GLM-5.3-Flash
1M
Offen
42
$0.43
30
1.28
84.56
66.62
Logo von Alibaba
Qwen3.8 2.4T A95B
262k
Offen
40
$2.89
78
1.48
33.57
25.67
Logo von DeepSeek
DeepSeek V4 Pro 0813 (max)
1M
Offen
36
$1.00
113
0.80
22.97
17.74
Logo von DeepSeek
DeepSeek V4 Flash 0731 (max)
1M
Offen
35
$0.10
57
0.87
45.01
35.32
Logo von Z AI
GLM-5.2 (max) (FP4)
1.05M
Offen
34
$0.65
60
1.06
42.74
33.34
Logo von Alibaba
Qwen3.8 27B (xhigh)
262k
Offen
34
$0.65
35
1.13
71.77
56.51
Logo von DeepSeek
DeepSeek V4 Pro (max) (FP4)
1.05M
Offen
31
$1.19
52
1.20
94.74
83.95
Logo von DeepSeek
DeepSeek V4 Pro (high) (FP4)
65.5k
Offen
30*
--
56
1.50
45.78
35.40
Logo von MiniMax
MiniMax-M3
524k
Offen
30
$0.44
24
1.00
106.63
84.50
Logo von Z AI
GLM-5 (FP4)
203k
Offen
28*
--
68
0.95
53.77
45.50
Logo von Kimi
Kimi K2.6 (FP4)
262k
Offen
27
$0.51
44
1.37
114.58
101.77
Logo von Z AI
GLM-5.1 (FP4)
203k
Offen
26
$0.69
31
0.85
137.62
120.83
Logo von Xiaomi
MiMo-V2.5-Pro
65.5k
Offen
26
$0.43
37
1.07
68.73
54.13
Logo von Kimi
Kimi K2.7 Code
262k
Offen
26
$0.39
41
0.91
67.89
54.70
Logo von Thinking Machines
Inkling Small
524k
Offen
26
$0.12
250
0.98
10.98
8.00
Logo von Tencent
Hy3 (FP8)
262k
Offen
26
$0.07
59
1.15
43.50
33.88
Logo von Thinking Machines
Inkling (FP8)
131k
Offen
26
$0.81
210
0.56
12.48
9.53
Logo von DeepSeek
DeepSeek V4 Flash (high) (FP4)
1.05M
Offen
25
$0.10
45
0.91
39.59
27.56
Logo von DeepSeek
DeepSeek V4 Flash (max) (FP4)
1.05M
Offen
25
$0.09
44
0.95
141.41
128.98
Logo von Z AI
GLM-5.1 (Non-reasoning) (FP4)
203k
Offen
24*
--
29
1.05
18.12
--
Logo von Kimi
Kimi K2.6 (Non-reasoning) (FP4)
262k
Offen
24*
--
34
1.49
16.08
--
Logo von Kimi
Kimi K2.5
262k
Offen
23*
--
43
1.38
81.31
68.41
Logo von NVIDIA
Nemotron 3 Ultra
262k
Offen
23
$0.47
127
3.35
25.16
17.88
Logo von NVIDIA
Nemotron 3 Ultra BF16
262k
Offen
23
$0.92
153
2.65
20.78
14.87
Logo von Alibaba
Qwen3.5 27B (FP8)
262k
Offen
23*
--
70
0.90
36.81
28.73
Logo von MiniMax
MiniMax-M2.5 (FP8)
197k
Offen
23*
--
22
5.49
118.62
90.51
Logo von Xiaomi
MiMo-V2.5
262k
Offen
22
$0.02
29
1.74
87.46
68.58
Logo von Z AI
GLM-4.7 (FP4)
203k
Offen
22*
--
18
1.74
143.59
113.48
Logo von Alibaba
Qwen3.6 27B FP8
262k
Offen
22
$0.37
65
0.94
95.81
87.19
Logo von Z AI
GLM-5 (Non-reasoning) (FP8)
203k
Offen
22*
--
56
1.39
10.30
--
Logo von DeepSeek
DeepSeek V3.2 (FP4)
164k
Offen
21*
--
28
1.67
91.22
71.64
Logo von Alibaba
Qwen3.5 397B A17B (Non-reasoning) (FP8)
262k
Offen
21*
--
41
0.94
13.25
--
Logo von InclusionAI
Ling 3.0 Flash
131k
Offen
21
$0.03
57
0.67
44.16
34.79
Logo von Alibaba
Qwen3.6 27B (Non-reasoning) FP8
262k
Offen
20*
--
60
0.92
9.25
--
Logo von StepFun
Step 3.7 Flash
256k
Offen
19*
--
168
0.66
15.54
11.90
Logo von Alibaba
Qwen3.5 27B (Non-reasoning) FP8
262k
Offen
19*
--
66
0.92
8.45
--
Logo von Alibaba
Qwen3.5 35B A3B (FP8)
262k
Offen
19*
--
159
0.80
16.50
12.56
Logo von Alibaba
Qwen3.5 397B A17B (FP8)
262k
Offen
19
$0.23
39
0.97
95.92
82.06
Logo von Alibaba
Qwen3.6 35B A3B (FP8)
262k
Offen
19
$0.14
93
0.70
63.90
57.84
Logo von Z AI
GLM-4.6 (FP4)
203k
Offen
19*
--
42
0.75
59.62
47.10
Logo von Xiaomi
MiMo-V2.5-Pro (Non-reasoning)
65.5k
Offen
18*
--
30
1.16
17.64
--
Logo von Meta
Muse Glimmer (high)
131k
Offen
18
$0.05
148
0.89
17.78
13.51
Logo von Alibaba
Qwen3.5 122B A10B (Non-reasoning) (FP4)
262k
Offen
18*
--
143
0.92
4.42
--
Logo von Z AI
GLM-4.7 (Non-reasoning) (FP4)
203k
Offen
17*
--
18
1.05
28.51
--
Logo von Google
Gemma 4 26B A4B (FP8)
262k
Offen
17*
--
31
0.89
81.03
64.11
Logo von Alibaba
Qwen3.5 122B A10B (FP4)
262k
Offen
16
$0.14
155
0.81
16.96
12.92
Logo von DeepSeek
DeepSeek V3.2 (Non-reasoning)
164k
Offen
16*
--
33
1.34
16.44
--
Logo von Google
Gemma 4 31B
262k
Offen
15
$0.02
15
2.14
149.62
114.50
Logo von Alibaba
Qwen3.6 35B A3B (Non-reasoning) (FP8)
262k
Offen
15*
--
92
0.69
6.12
--
Logo von Alibaba
Qwen3.5 35B A3B (Non-reasoning) FP8
262k
Offen
15*
--
154
0.72
3.97
--
Logo von Z AI
GLM-4.7-Flash
203k
Offen
15*
--
35
1.56
72.92
57.09
Logo von IBM
Granite 4.2 30B
131k
Offen
15*
--
77
0.80
33.16
25.89
Logo von DeepSeek
DeepSeek V3.1 Terminus (Non-reasoning) (FP4)
164k
Offen
14*
--
60
0.97
9.35
--
Logo von Google
Gemma 4 31B (Non-reasoning) (FP8)
262k
Offen
14*
--
20
1.45
26.12
--
Logo von DeepSeek
DeepSeek V3.1 (Non-reasoning) (FP4)
164k
Offen
14*
--
12
1.00
43.44
--
Logo von NVIDIA
Nemotron 3.5 Lightning (NVFP4)
262k
Offen
14
$0.12
--
--
--
--
Logo von NVIDIA
Nemotron 3 Super
262k
Offen
14
$0.48
90
13.04
40.86
22.26
Logo von Google
Gemma 4 26B A4B (Non-reasoning) (FP8)
262k
Offen
13*
--
23
0.82
22.42
--
Logo von Alibaba
Qwen3.5 4B (FP8)
262k
Offen
13*
--
29
0.72
85.88
68.12
Logo von DeepSeek
DeepSeek R1 0528
164k
Offen
13*
--
23
0.93
109.29
86.69
Logo von Alibaba
Qwen3 235B A22B 2507 (FP8)
262k
Offen
13
--
92
0.78
27.85
21.65
Logo von OpenAI
gpt-oss-120b (high) (Turbo)
131k
Offen
12
$0.11
230
0.76
11.61
8.68
Logo von OpenAI
gpt-oss-120b (high)
131k
Offen
12
$0.03
59
0.59
43.28
34.15
Logo von Alibaba
Qwen3 235B 2507 (Non-reasoning) (FP8)
262k
Offen
12*
--
16
0.67
32.20
--
Logo von Alibaba
Qwen3 Coder 480B (Turbo, FP4)
262k
Offen
12*
--
73
0.65
7.54
--
Logo von IBM
Granite 4.2 8B
131k
Offen
12
$0.02
72
0.64
35.43
27.84
Logo von Alibaba
Qwen3.5 4B (Non-reasoning) FP8
262k
Offen
11*
--
22
0.69
23.52
--
Logo von OpenAI
gpt-oss-120b (low)
131k
Offen
10*
--
55
0.63
46.38
36.60
Logo von DeepSeek
DeepSeek V3 0324 (FP4)
164k
Offen
10
$0.02
46
1.09
12.01
--
Logo von Alibaba
Qwen3 Next 80B A3B
262k
Offen
10*
--
160
0.70
3.83
--
Logo von Meta
Llama 4 Maverick (FP8)
1.05M
Offen
9
$0.03
74
0.51
7.26
--
Logo von IBM
Granite 4.2 3B
131k
Offen
9
$0.01
214
0.45
12.15
9.37
Logo von OpenAI
gpt-oss-20b (high)
131k
Offen
9
$0.01
118
0.44
21.64
16.96
Logo von NVIDIA
Llama Nemotron Super 49B v1.5
131k
Offen
9*
--
95
4.25
30.66
21.13
Logo von Google
Gemma 4 E4B
262k
Offen
9*
--
44
0.81
57.51
45.36
Logo von NVIDIA
Nemotron 3 Nano
262k
Offen
9
$0.02
104
4.46
28.43
19.18
Logo von DeepSeek
DeepSeek V3 (Dec)
164k
Offen
8
$0.02
29
0.66
17.81
--
Logo von DeepSeek
DeepSeek R1 Distill Llama 70B
131k
Offen
8*
--
25
0.99
100.22
79.39
Logo von Alibaba
Qwen2.5 72B
32.8k
Offen
8*
--
29
2.33
19.68
--
Logo von Meta
Llama 3.3 70B (Turbo, FP8)
131k
Offen
8*
--
16
2.10
34.16
--
Logo von Alibaba
Qwen3 30B (FP8)
41k
Offen
8*
--
159
0.51
16.23
12.57
Logo von NVIDIA
NVIDIA Nemotron Nano 12B v2 VL (FP8)
131k
Offen
7*
--
148
3.29
20.22
13.55
Logo von Google
Gemma 4 E4B (Non-reasoning)
262k
Offen
7*
--
45
0.77
11.92
--
Logo von NVIDIA
NVIDIA Nemotron Nano 9B V2
131k
Offen
7*
--
92
7.88
35.01
21.70
Logo von Mistral
Mistral Small 3.1
128k
Offen
7
$0.02
36
0.93
15.00
--
Logo von NVIDIA
Llama Nemotron Super 49B v1.5 (Non-reasoning)
131k
Offen
7*
--
161
3.02
6.13
--
Logo von Alibaba
Qwen3 32B (Non-reasoning) (FP8)
41k
Offen
7*
--
27
1.51
20.32
--
Logo von Alibaba
Qwen3 32B (FP8)
41k
Offen
7
--
29
1.48
88.88
69.92
Logo von Mistral
Mistral Small 3.2 (FP8)
128k
Offen
7
$0.11
41
0.90
13.22
--
Logo von NVIDIA
Llama 3.1 Nemotron 70B
131k
Offen
7*
--
145
2.97
6.41
--
Logo von Meta
Llama 3.1 8B (Turbo, FP8)
131k
Offen
7*
--
25
0.92
20.83
--
Logo von Meta
Llama 3.1 8B
131k
Offen
7*
--
20
0.98
25.70
--
Logo von NVIDIA
Nemotron 3 Nano (Non-reasoning)
262k
Offen
7*
--
102
0.67
5.59
--
Logo von NVIDIA
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)
131k
Offen
7*
--
103
5.72
10.57
--
Logo von Alibaba
Qwen3 14B (Non-reasoning) (FP8)
41k
Offen
7*
--
61
0.80
9.00
--
Logo von Mistral
Mistral Small 3
32.8k
Offen
7*
--
52
0.82
10.51
--
Logo von Alibaba
Qwen3 30B (Non-reasoning) (FP8)
41k
Offen
7*
--
164
0.50
3.56
--
Logo von Meta
Llama 3.1 70B
131k
Offen
7*
--
35
1.93
16.22
--
Logo von Meta
Llama 3.1 70B (Turbo, FP8)
131k
Offen
7*
--
35
1.97
16.06
--
Logo von Meta
Llama 4 Scout
328k
Offen
6
$0.06
23
1.06
22.49
--
Logo von Alibaba
Qwen3 14B (FP8)
32.8k
Offen
6
--
57
0.85
44.88
35.23
Logo von Nous Research
Hermes 3 - Llama-3.1 70B
131k
Offen
6*
--
31
2.14
18.03
--
Logo von Microsoft
Phi-4
16.4k
Offen
6*
--
56
0.93
9.82
--
Logo von NVIDIA
NVIDIA Nemotron Nano 12B v2 VL (Non-reasoning) (FP8)
131k
Offen
6*
--
138
3.91
7.53
--
Logo von Meta
Llama 3.2 11B (Vision)
131k
Offen
5*
--
19
1.23
27.14
--
Logo von Google
Gemma 3 27B
131k
Offen
5
$0.16
25
1.41
21.03
--
Logo von Google
Gemma 3 4B
131k
Offen
5*
--
19
1.71
28.14
--
Logo von Meta
Llama 3 8B
8.19k
Offen
5*
--
--
--
--
--
Logo von Google
Gemma 3 12B
131k
Offen
4
$0.13
39
1.06
13.76
--

Wichtige Definitionen

Häufig gestellte Fragen

Häufige Fragen zu DeepInfra