DeepInfra: inteligencia, rendimiento y precio de sus modelos

DeepInfra
DeepInfra

Este análisis está pensado para ayudarte a elegir el mejor modelo ofrecido por DeepInfra para tu caso de uso.

Más inteligente

Updated
#1
MiMo-V2.6-ProMiMo-V2.6-Pro
46
#2
GLM-5.3 (max)GLM-5.3 (max)
45
#3
GLM-5.3-FlashGLM-5.3-Flash
42
#4
Qwen3.8 2.4T A95BQwen3.8 2.4T A95B
40
#5
DeepSeek V4.1 Flash (max)DeepSeek V4.1 Flash (max)
39

Índice de inteligencia

103 modelos en total

Más rápido

#1
gpt-oss-120b (high) (Turbo)gpt-oss-120b (high) (Turbo)
349 t/s
#2
Inkling SmallInkling Small
254 t/s
#3
Granite 4.2 3BGranite 4.2 3B
223 t/s
#4
Qwen3 Next 80B A3BQwen3 Next 80B A3B
195 t/s
#5
Qwen3.5 122B A10B (FP4)Qwen3.5 122B A10B (FP4)
172 t/s

Velocidad de salida

103 modelos en total

Menor precio

#1
Llama 3.1 8B (Turbo, FP8)Llama 3.1 8B (Turbo, FP8)
$0.02
#2
Llama 3.1 8BLlama 3.1 8B
$0.02
#3
Granite 4.2 3BGranite 4.2 3B
$0.02
#4
Gemma 4 E4BGemma 4 E4B
$0.03
#5
Gemma 4 E4B (Non-reasoning)Gemma 4 E4B (Non-reasoning)
$0.03

Precio combinado (por 1M de tokens)

103 modelos en total

DeepInfra ofrece 103 modelos, cada uno con distintas características de inteligencia, rendimiento y precio. A continuación se comparan las métricas clave entre modelos.

  • En inteligencia, los mejores modelos en DeepInfra son MiMo-V2.6-Pro (46), GLM-5.3 (max) (45) y GLM-5.3-Flash (42).
  • En velocidad de salida, los modelos más rápidos son gpt-oss-120b (high) (Turbo) (349 t/s), Inkling Small (254 t/s) y Granite 4.2 3B (223 t/s). La velocidad varía significativamente entre modelos, con una diferencia del 103% entre el más rápido y el más lento.
  • En latencia, Llama 4 Maverick (FP8) (0.55s), Qwen3 30B (Non-reasoning) (FP8) (0.57s) y Qwen3.5 122B A10B (Non-reasoning) (FP4) (0.69s) ofrecen el menor tiempo hasta el primer token de respuesta.
  • En precios, Llama 3.1 8B (Turbo, FP8) ($0.02), Llama 3.1 8B ($0.02) y Granite 4.2 3B ($0.02) ofrecen los menores precios combinados por 1M de tokens.
  • En tamaño de ventana de contexto, GLM-5.2 (max) (FP4) (1M), DeepSeek V4 Pro (max) (FP4) (1M) y DeepSeek V4 Flash (high) (FP4) (1M) admiten las ventanas de contexto más grandes en DeepInfra.

Aspectos destacados

Updated
Artificial Analysis Intelligence Index · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Evaluaciones de inteligencia

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 incorporates 10 evaluations: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
Estimate (independent evaluation forthcoming)

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better
See more

Agentic knowledge work, (Elo-500)/2000

Agentic real-world work tasks, (Elo-500)/2000

Agentic SaaS workflows

Agentic coding & terminal use

Coding

Reasoning & knowledge

Professional document reasoning, All-pass

CritPtUnder review

Physics reasoning

Long context reasoning

Legal agentic work, criterion pass rate

Agentic business operations

Agentic scientific research workflows in a terminal

Quantitative analysis on spreadsheets & documents

Agentic tool use

Kubernetes incident root-cause analysis

Visual reasoning

Medical long context reasoning

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Ventana de contexto

Context Window

Context window: tokens limit · Higher is better

Precios

Intelligence Index vs. Price

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Resumen de rendimiento

Output Speed vs. Price

Output speed: output tokens per second · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Velocidad

Medida por la velocidad de salida (tokens por segundo)

Output Speed

Output tokens per second · Higher is better

Latencia

Medida por el tiempo (segundos) hasta el primer token

Latency: Time To First Answer Token

Seconds to first answer token received · Accounts for reasoning model 'thinking' time

Tiempo de respuesta de extremo a extremo

Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed

End-to-End Response Time vs. Price

End-to-end response time: end-to-end seconds to output 500 tokens · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Análisis adicional
Logo de Xiaomi
MiMo-V2.6-Pro
1M
Abierto
46
$0.12
27
1.86
93.31
73.16
Logo de Z AI
GLM-5.3 (max)
1.05M
Abierto
45
$1.39
169
1.04
15.83
11.83
Logo de Z AI
GLM-5.3-Flash
1M
Abierto
42
$0.34
39
1.23
65.81
51.66
Logo de Alibaba
Qwen3.8 2.4T A95B
262k
Abierto
40
$2.89
104
1.42
25.51
19.27
Logo de DeepSeek
DeepSeek V4.1 Flash (max)
1M
Abierto
39
$0.44
54
0.94
47.15
36.97
Logo de DeepSeek
DeepSeek V4 Pro 0813 (max)
1M
Abierto
36
$1.00
77
0.93
33.28
25.88
Logo de DeepSeek
DeepSeek V4 Flash Vision (max)
1M
Propietario
35
$0.51
150
0.98
17.64
13.32
Logo de DeepSeek
DeepSeek V4 Flash 0731 (max)
1M
Abierto
34
$0.10
66
0.87
38.85
30.38
Logo de Z AI
GLM-5.2 (max) (FP4)
1.05M
Abierto
34
$0.37
109
1.04
23.99
18.36
Logo de Alibaba
Qwen3.8 27B (xhigh)
262k
Abierto
34
$0.52
33
1.07
75.72
59.73
Logo de DeepSeek
DeepSeek V4 Pro (max) (FP4)
1.05M
Abierto
30
$1.19
64
1.14
77.44
68.48
Logo de DeepSeek
DeepSeek V4 Pro (high) (FP4)
65.5k
Abierto
30*
--
63
1.20
41.02
31.83
Logo de MiniMax
MiniMax-M3
524k
Abierto
29
$0.44
22
1.00
112.59
89.27
Logo de Z AI
GLM-5 (FP4)
203k
Abierto
28*
--
91
1.15
40.96
34.28
Logo de Thinking Machines
Inkling Small
524k
Abierto
28*
--
256
0.56
10.32
7.81
Logo de Kimi
Kimi K2.6 (FP4)
262k
Abierto
27
$0.51
46
1.66
109.07
96.56
Logo de Z AI
GLM-5.1 (FP4)
203k
Abierto
26
$0.58
100
1.35
44.18
37.84
Logo de DeepSeek
DeepSeek V4 Flash (high) (FP4)
1.05M
Abierto
26*
--
38
1.14
46.60
32.39
Logo de Xiaomi
MiMo-V2.5-Pro
65.5k
Abierto
26
$0.28
38
1.41
67.03
52.49
Logo de Kimi
Kimi K2.7 Code
262k
Abierto
26
$0.39
53
1.00
52.21
41.83
Logo de Tencent
Hy3 (FP8)
262k
Abierto
25
$0.07
42
0.93
60.28
47.48
Logo de Xiaomi
MiMo-V2.5
262k
Abierto
25*
--
13
1.05
188.41
149.88
Logo de Thinking Machines
Inkling (FP8)
131k
Abierto
25
--
148
0.69
17.60
13.53
Logo de InclusionAI
Ling 3.0 Flash
131k
Abierto
25*
--
49
2.03
53.54
41.20
Logo de Z AI
GLM-5.1 (Non-reasoning) (FP4)
203k
Abierto
24*
--
108
1.19
5.82
--
Logo de DeepSeek
DeepSeek V4 Flash (max) (FP4)
1.05M
Abierto
24
$0.07
41
1.00
149.45
136.30
Logo de Kimi
Kimi K2.6 (Non-reasoning) (FP4)
262k
Abierto
24*
--
30
1.48
17.97
--
Logo de Kimi
Kimi K2.5
262k
Abierto
23*
--
41
1.56
86.90
73.03
Logo de NVIDIA
Nemotron 3 Ultra
262k
Abierto
23
$0.47
163
1.07
18.07
13.94
Logo de NVIDIA
Nemotron 3 Ultra BF16
262k
Abierto
23
$0.99
183
1.21
16.35
12.42
Logo de Alibaba
Qwen3.5 27B (FP8)
262k
Abierto
23*
--
75
1.04
34.51
26.77
Logo de MiniMax
MiniMax-M2.5 (FP8)
197k
Abierto
23*
--
21
1.07
121.92
96.68
Logo de Z AI
GLM-4.7 (FP4)
203k
Abierto
22*
--
18
1.02
136.93
108.72
Logo de Z AI
GLM-5 (Non-reasoning) (FP8)
203k
Abierto
22*
--
84
1.07
7.02
--
Logo de DeepSeek
DeepSeek V3.2 (FP4)
164k
Abierto
21*
--
16
1.36
161.01
127.72
Logo de Alibaba
Qwen3.5 397B A17B (Non-reasoning) (FP8)
262k
Abierto
21*
--
38
1.21
14.34
--
Logo de Alibaba
Qwen3.6 27B FP8
262k
Abierto
21
$0.37
53
0.97
117.75
107.32
Logo de Alibaba
Qwen3.6 27B (Non-reasoning) FP8
262k
Abierto
20*
--
41
1.22
13.33
--
Logo de StepFun
Step 3.7 Flash
256k
Abierto
19*
--
162
0.72
16.11
12.32
Logo de Alibaba
Qwen3.5 27B (Non-reasoning) FP8
262k
Abierto
19*
--
73
1.07
7.95
--
Logo de Alibaba
Qwen3.5 35B A3B (FP8)
262k
Abierto
19*
--
153
0.71
17.08
13.10
Logo de Google
Gemma 4 31B
262k
Abierto
19*
--
15
3.19
147.67
112.17
Logo de Z AI
GLM-4.6 (FP4)
203k
Abierto
19*
--
21
1.25
119.22
94.38
Logo de Alibaba
Qwen3.5 397B A17B (FP8)
262k
Abierto
18
--
39
1.23
96.79
82.59
Logo de Xiaomi
MiMo-V2.5-Pro (Non-reasoning)
65.5k
Abierto
18*
--
33
1.59
16.93
--
Logo de Alibaba
Qwen3.6 35B A3B (FP8)
262k
Abierto
18
$0.14
80
0.81
74.77
67.68
Logo de Alibaba
Qwen3.5 122B A10B (Non-reasoning) (FP4)
262k
Abierto
18*
--
172
0.69
3.60
--
Logo de Meta
Muse Glimmer (high)
131k
Abierto
17
$0.05
132
0.99
19.90
15.13
Logo de Z AI
GLM-4.7 (Non-reasoning) (FP4)
203k
Abierto
17*
--
26
1.15
20.66
--
Logo de Google
Gemma 4 26B A4B (FP8)
262k
Abierto
17*
--
32
0.79
80.13
63.47
Logo de DeepSeek
DeepSeek V3.2 (Non-reasoning)
164k
Abierto
16*
--
15
1.26
35.08
--
Logo de Alibaba
Qwen3.5 122B A10B (FP4)
262k
Abierto
16
$0.24
173
0.67
15.16
11.59
Logo de Alibaba
Qwen3.6 35B A3B (Non-reasoning) (FP8)
262k
Abierto
15*
--
59
0.99
9.47
--
Logo de Alibaba
Qwen3.5 35B A3B (Non-reasoning) FP8
262k
Abierto
15*
--
153
0.74
4.00
--
Logo de Z AI
GLM-4.7-Flash
203k
Abierto
15*
--
41
1.28
61.64
48.29
Logo de IBM
Granite 4.2 30B
131k
Abierto
15*
--
77
0.91
33.41
26.00
Logo de DeepSeek
DeepSeek V3.1 Terminus (Non-reasoning) (FP4)
164k
Abierto
14*
--
60
0.96
9.23
--
Logo de Google
Gemma 4 31B (Non-reasoning) (FP8)
262k
Abierto
14*
--
15
2.35
35.25
--
Logo de DeepSeek
DeepSeek V3.1 (Non-reasoning) (FP4)
164k
Abierto
14*
--
8
1.19
61.49
--
Logo de Google
Gemma 4 26B A4B (Non-reasoning) (FP8)
262k
Abierto
13*
--
31
0.75
16.95
--
Logo de Alibaba
Qwen3.5 4B (FP8)
262k
Abierto
13*
--
25
0.81
100.72
79.92
Logo de DeepSeek
DeepSeek R1 0528
164k
Abierto
13*
--
--
--
--
--
Logo de NVIDIA
Nemotron 3.5 Lightning (NVFP4)
262k
Abierto
13
$0.12
--
--
--
--
Logo de NVIDIA
Nemotron 3 Super
262k
Abierto
13
$0.48
--
--
--
--
Logo de Alibaba
Qwen3 235B A22B 2507 (FP8)
262k
Abierto
13
--
69
0.81
36.96
28.92
Logo de Alibaba
Qwen3 235B 2507 (FP8)
262k
Abierto
12*
--
16
0.65
31.02
--
Logo de Alibaba
Qwen3 Coder 480B (Turbo, FP4)
262k
Abierto
12*
--
46
0.83
11.80
--
Logo de OpenAI
gpt-oss-120b (high) (Turbo)
131k
Abierto
12
$0.11
338
0.71
8.11
5.92
Logo de OpenAI
gpt-oss-120b (high)
131k
Abierto
12
$0.03
54
0.73
46.86
36.90
Logo de IBM
Granite 4.2 8B
131k
Abierto
11
$0.02
72
0.93
35.77
27.87
Logo de Alibaba
Qwen3.5 4B (Non-reasoning) FP8
262k
Abierto
11*
--
25
0.78
21.14
--
Logo de OpenAI
gpt-oss-120b (low)
131k
Abierto
10*
--
45
0.68
55.85
44.13
Logo de Meta
Llama 4 Maverick (FP8)
1.05M
Abierto
10*
--
100
0.53
5.55
--
Logo de DeepSeek
DeepSeek V3 0324 (FP4)
164k
Abierto
10
$0.02
44
1.10
12.41
--
Logo de Alibaba
Qwen3 Next 80B A3B
262k
Abierto
10*
--
194
0.69
3.26
--
Logo de IBM
Granite 4.2 3B
131k
Abierto
9
$0.01
221
0.46
11.79
9.07
Logo de OpenAI
gpt-oss-20b (high)
131k
Abierto
9
$0.01
101
0.49
25.23
19.79
Logo de Google
Gemma 4 E4B
262k
Abierto
9*
--
60
0.85
42.50
33.32
Logo de NVIDIA
Nemotron 3 Nano
262k
Abierto
9
$0.02
95
4.22
30.62
21.12
Logo de Alibaba
Qwen3 32B (FP8)
41k
Abierto
9*
--
30
1.49
85.21
66.97
Logo de DeepSeek
DeepSeek V3 (Dec)
164k
Abierto
8
$0.02
23
0.83
22.62
--
Logo de Mistral
Mistral Small 3.2 (FP8)
128k
Abierto
8*
--
43
0.94
12.58
--
Logo de Alibaba
Qwen3 14B (FP8)
32.8k
Abierto
8*
--
28
1.16
91.09
71.94
Logo de Meta
Llama 4 Scout
328k
Abierto
8*
--
28
0.90
18.94
--
Logo de DeepSeek
DeepSeek R1 Distill Llama 70B
131k
Abierto
8*
--
--
--
--
--
Logo de Alibaba
Qwen2.5 72B
32.8k
Abierto
8*
--
25
2.25
22.27
--
Logo de Meta
Llama 3.3 70B (Turbo, FP8)
131k
Abierto
8*
--
10
2.88
54.57
--
Logo de Alibaba
Qwen3 30B (FP8)
41k
Abierto
8*
--
151
0.56
17.16
13.28
Logo de Google
Gemma 4 E4B (Non-reasoning)
262k
Abierto
7*
--
60
0.76
9.04
--
Logo de NVIDIA
NVIDIA Nemotron Nano 9B V2
131k
Abierto
7*
--
111
3.79
26.32
18.02
Logo de Alibaba
Qwen3 32B (Non-reasoning) (FP8)
41k
Abierto
7*
--
29
1.51
18.59
--
Logo de Mistral
Mistral Small 3.1
128k
Abierto
7
$0.02
43
0.88
12.57
--
Logo de Meta
Llama 3.1 8B (Turbo, FP8)
131k
Abierto
7*
--
23
1.16
22.78
--
Logo de Meta
Llama 3.1 8B
131k
Abierto
7*
--
19
1.10
26.84
--
Logo de NVIDIA
Nemotron 3 Nano (Non-reasoning)
262k
Abierto
7*
--
97
0.71
5.85
--
Logo de NVIDIA
NVIDIA Nemotron Nano 9B V2 (Non-reasoning)
131k
Abierto
7*
--
115
6.68
11.03
--
Logo de Alibaba
Qwen3 14B (Non-reasoning) (FP8)
41k
Abierto
7*
--
25
1.97
21.76
--
Logo de Mistral
Mistral Small 3
32.8k
Abierto
7*
--
55
0.90
10.02
--
Logo de Alibaba
Qwen3 30B (Non-reasoning) (FP8)
41k
Abierto
7*
--
137
0.57
4.23
--
Logo de Meta
Llama 3.1 70B
131k
Abierto
7*
--
40
1.86
14.48
--
Logo de Meta
Llama 3.1 70B (Turbo, FP8)
131k
Abierto
7*
--
41
2.02
14.31
--
Logo de Nous Research
Hermes 3 - Llama-3.1 70B
131k
Abierto
6*
--
30
2.17
18.59
--
Logo de Microsoft
Phi-4
16.4k
Abierto
6*
--
67
0.93
8.37
--
Logo de Meta
Llama 3.2 11B (Vision)
131k
Abierto
5*
--
15
2.33
36.39
--
Logo de Google
Gemma 3 27B
131k
Abierto
5
$0.16
16
1.49
32.46
--
Logo de Google
Gemma 3 4B
131k
Abierto
5*
--
27
1.10
19.62
--
Logo de Meta
Llama 3 8B
8.19k
Abierto
5*
--
--
--
--
--
Logo de Google
Gemma 3 12B
131k
Abierto
4
$0.13
47
1.04
11.79
--

Definiciones clave

Preguntas frecuentes

Preguntas comunes sobre DeepInfra