CoreWeave: Intelligenz, Leistung und Preise der Modelle

CoreWeave
CoreWeave

Diese Analyse soll Sie bei der Auswahl des besten von CoreWeave angebotenen Modells für Ihren Anwendungsfall unterstützen.

Höchste Intelligenz

Updated
#1
GLM-5.3-FlashGLM-5.3-Flash
42
#2
DeepSeek V4.1 Flash (max)DeepSeek V4.1 Flash (max)
39
#3
DeepSeek V4 Flash 0731 (max)DeepSeek V4 Flash 0731 (max)
34
#4
GLM-5.2 (max)GLM-5.2 (max)
34
#5
Qwen3.8 27B (xhigh) (FP8)Qwen3.8 27B (xhigh) (FP8)
34

Intelligence Index

Insgesamt 28 Modelle

Am schnellsten

#1
Nemotron 3.5 Lightning (BF16)Nemotron 3.5 Lightning (BF16)
375 t/s
#2
Nemotron 3 UltraNemotron 3 Ultra
321 t/s
#3
Kimi K2.7 CodeKimi K2.7 Code
288 t/s
#4
DeepSeek V4.1 Flash (non-reasoning)DeepSeek V4.1 Flash (non-reasoning)
257 t/s
#5
GLM-5.2 (max)GLM-5.2 (max)
237 t/s

Ausgabegeschwindigkeit

Insgesamt 28 Modelle

Niedrigster Preis

#1
gpt-oss-20b (low)gpt-oss-20b (low)
$0.04
#2
gpt-oss-20b (high)gpt-oss-20b (high)
$0.04
#3
gpt-oss-120b (high)gpt-oss-120b (high)
$0.04
#4
gpt-oss-120b (low)gpt-oss-120b (low)
$0.04
#5
Granite 4.2 8BGranite 4.2 8B
$0.07

Mischpreis (pro 1 Mio. Tokens)

Insgesamt 28 Modelle

CoreWeave bietet 28 Modelle mit jeweils unterschiedlichen Merkmalen bei Intelligenz, Leistung und Preis an. Nachfolgend werden die wichtigsten Metriken der Modelle verglichen.

  • Bei der Intelligenz sind GLM-5.3-Flash (42), DeepSeek V4.1 Flash (max) (39) und DeepSeek V4 Flash 0731 (max) (34) die führenden Modelle von CoreWeave.
  • Bei der Ausgabegeschwindigkeit sind Nemotron 3.5 Lightning (BF16) (375 t/s), Nemotron 3 Ultra (321 t/s) und Kimi K2.7 Code (288 t/s) am schnellsten. Die Geschwindigkeit unterscheidet sich deutlich zwischen den Modellen; der Unterschied zwischen dem schnellsten und dem langsamsten beträgt 58 %.
  • Bei der Latenz bieten Gemma 4 26B A4B (non-reasoning) (0.56 s), Llama 3.1 8B (0.66 s) und Llama 3.3 70B (0.85 s) die kürzeste Zeit bis zum ersten Antworttoken.
  • Beim Preis bieten gpt-oss-20b (low) ($0.04), gpt-oss-20b (high) ($0.04) und gpt-oss-120b (high) ($0.04) die niedrigsten Mischpreise pro 1 Mio. Tokens.
  • Bei der Größe des Kontextfensters unterstützen GLM-5.3-Flash (1M), DeepSeek V4.1 Flash (max) (1M) und DeepSeek V4 Pro (max) (1M) die größten Kontextfenster von CoreWeave.
Updated
Artificial Analysis Intelligence Index · Higher is better
Output tokens per second · Higher is better
USD per 1M tokens (blended) · Lower is better

Intelligenzevaluationen

Artificial Analysis Intelligence Index

Artificial Analysis Intelligence Index v4.3.2 incorporates 10 evaluations: AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience, AA-LCR v1.1
Estimate (independent evaluation forthcoming)

Intelligence Evaluations

Intelligence evaluations measured independently by Artificial Analysis · Higher is better
Mehr anzeigen

Agentic knowledge work, (Elo-500)/2000

Agentic real-world work tasks, (Elo-500)/2000

Agentic SaaS workflows

Agentic coding & terminal use

SciCodeUnder review

Coding

Reasoning & knowledge

Professional document reasoning, All-pass

CritPtUnder review

Physics reasoning

Long context reasoning

Legal agentic work, criterion pass rate

Agentic business operations

Agentic scientific research workflows in a terminal

Quantitative analysis on spreadsheets & documents

Kubernetes incident root-cause analysis

Visual reasoning

Medical long context reasoning

Intelligence Index vs. Preis

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Kontextfenster

Kontextfenster

Context window: tokens limit · Higher is better

Preise

Intelligence Index vs. Preis

Blended at 7:2:1 (cache-input-output) · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Leistungsübersicht

Ausgabegeschwindigkeit vs. Preis

Output speed: output tokens per second · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Geschwindigkeit

Gemessen anhand der Ausgabegeschwindigkeit (Tokens pro Sekunde)

Ausgabegeschwindigkeit

Output tokens per second · Higher is better

Latenz

Gemessen anhand der Zeit (Sekunden) bis zum ersten Token

Latenz: Zeit bis zum ersten Antworttoken

Sekunden bis zum ersten Antwort-Token · Berücksichtigt die „Denkzeit“ von Reasoning-Modellen

Cache-Verhalten

Cache-Trefferquote

Anteil der cachefähigen Eingabe-Token aus dem Cache · Median der letzten vier Wochen, aktualisiert am 26. Sept. 2026

Kosten pro Aufgabe vs. Cache-Trefferquote

Weighted average cost (USD) per Intelligence Index task · Cache hit rate: median of the last four weeks, updated Sep 26, 2026
Most attractive quadrant
Pareto line

Ende-zu-Ende-Antwortzeit

Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed

Ende-zu-Ende-Antwortzeit vs. Preis

End-to-end response time: end-to-end seconds to output 500 tokens · USD per 1M tokens (blended)
Most attractive quadrant
Pareto line

Weitere Analyse
Logo von Z AI
GLM-5.3-Flash
1M
Offen
42
$0.65
180
1.56
15.43
11.09
Logo von DeepSeek
DeepSeek V4.1 Flash (max)
1M
Offen
39
$1.03
228
0.92
11.89
8.78
Logo von DeepSeek
DeepSeek V4 Flash 0731 (max)
262k
Offen
34
$0.44
127
1.59
21.32
15.78
Logo von Z AI
GLM-5.2 (max)
262k
Offen
34
$0.70
237
1.10
11.63
8.42
Logo von Alibaba
Qwen3.8 27B (xhigh) (FP8)
262k
Offen
34
$0.92
62
1.63
41.71
32.06
Logo von DeepSeek
DeepSeek V4 Pro (max)
1M
Offen
30
$2.00
151
1.19
33.46
28.96
Logo von MiniMax
MiniMax-M3 (NVFP4)
262k
Offen
29
--
83
1.33
31.38
24.04
Logo von Z AI
GLM-5 (FP8)
200k
Offen
28*
--
--
--
--
--
Logo von Kimi
Kimi K2.6
262k
Offen
27
$1.11
205
1.04
25.20
21.72
Logo von Kimi
Kimi K2.7 Code
262k
Offen
26
$0.83
286
0.94
10.48
7.79
Logo von DeepSeek
DeepSeek V4.1 Flash (non-reasoning)
1M
Offen
25
$0.70
253
0.86
2.84
--
Logo von Kimi
Kimi K2.6 (non-reasoning)
262k
Offen
24*
--
173
1.04
3.93
--
Logo von NVIDIA
Nemotron 3 Ultra
262k
Offen
23
$0.51
290
0.92
10.48
7.84
Logo von DeepSeek
DeepSeek V4 Pro (non-reasoning)
1M
Offen
21*
--
162
1.24
4.32
--
Logo von Alibaba
Qwen3.6 35B A3B (FP8)
262k
Offen
18
$0.31
172
0.98
35.27
31.38
Logo von Google
Gemma 4 26B A4B
262k
Offen
17*
--
92
0.59
27.67
21.66
Logo von Alibaba
Qwen3.6 35B A3B (non-reasoning) (FP8)
262k
Offen
15*
--
177
0.98
3.81
--
Logo von Google
Gemma 4 31B
262k
Offen
15
$0.07
48
1.88
48.06
35.85
Logo von Google
Gemma 4 31B (non-reasoning)
262k
Offen
14*
--
58
1.92
10.54
--
Logo von DeepSeek
DeepSeek V3.1 (non-reasoning)
128k
Offen
14*
--
69
1.27
8.49
--
Logo von Google
Gemma 4 26B A4B (non-reasoning)
262k
Offen
13*
--
95
0.55
5.80
--
Logo von NVIDIA
Nemotron 3.5 Lightning (BF16)
262k
Offen
13
$0.10
375
0.56
7.23
5.33
Logo von OpenAI
gpt-oss-120b (high)
131k
Offen
12
$0.02
41
1.18
62.03
48.68
Logo von IBM
Granite 4.2 8B
131k
Offen
11
$0.05
102
0.72
25.33
19.68
Logo von OpenAI
gpt-oss-120b (low)
131k
Offen
10*
--
39
1.23
64.68
50.76
Logo von OpenAI
gpt-oss-20b (low)
131k
Offen
10*
--
205
0.54
12.73
9.76
Logo von OpenAI
gpt-oss-20b (high)
131k
Offen
9
$0.01
197
0.55
13.25
10.16
Logo von Meta
Llama 3.3 70B
128k
Offen
8*
--
82
0.84
6.91
--
Logo von Meta
Llama 3.1 8B
128k
Offen
7*
--
141
0.66
4.21
--

Wichtige Definitionen

Häufig gestellte Fragen

Häufige Fragen zu CoreWeave