Codex vs. Grok Build
Vergleich von Codex und Grok Build im Artificial Analysis Coding Agent Index, einschließlich Benchmark-Werten, Kosten, Ausführungszeit und Tokenverbrauch.
Einzelheiten zu unserer Methodik finden Sie auf unserer Methodikseite.
Weitere Vergleiche entdecken
vs
Wichtigste Ergebnisse
Vergleich
Direkter Vergleich von Codex und Grok Build.
Programmieragenten-Vergleich
Metrik | Analyse | ||
|---|---|---|---|
Agent-Harness | Codex | Grok Build | |
Repräsentatives Modell | GPT-5.6 Sol (max) | Grok 4.5 (high) | |
Coding Agent Index | 65 | 64 | Codex hat einen höheren Coding Agent Index als Grok Build |
DeepSWE | 69% | 60% | Codex hat einen höheren DeepSWE-Wert als Grok Build |
Terminal-Bench v2.1 | 83% | 84% | Grok Build hat einen höheren Terminal-Bench v2.1-Wert als Codex |
SWE-Atlas-QnA | 43% | 48% | Grok Build hat einen höheren SWE-Atlas-QnA-Wert als Codex |
Kosten pro Aufgabe | $6.42 | $2.44 | Grok Build hat geringere Kosten pro Aufgabe als Codex |
Zeit pro Aufgabe | 10.2m | 15.5m | Codex hat eine geringere Zeit pro Aufgabe als Grok Build |
Runden pro Aufgabe | 112.3 | 60.7 | Grok Build hat weniger Runden pro Aufgabe als Codex |
Token-Nutzung pro Aufgabe | 13.2M | 3.6M | Grok Build hat eine geringere Token-Nutzung pro Aufgabe als Codex |
Cache-Trefferquote | 90% | 92% | Grok Build hat eine höhere Cache-Trefferquote als Codex |
Modellvarianten
Bewertete Modellvarianten für Codex und Grok Build.
Modellvarianten
65 | 69% | 83% | 43% | $6.42 | 10.2m | 13.2M | ||
64 | 65% | 82% | 45% | $3.85 | 6.2m | 8M | ||
63 | 67% | 80% | 43% | $4.80 | 7.3m | 9.9M | ||
62 | 64% | 81% | 40% | $2.81 | 5.0m | 5.8M | ||
61 | 64% | 83% | 36% | $4.75 | 10.2m | 12.2M | ||
60 | 67% | 78% | 36% | $2.70 | 8.2m | 9.6M | ||
57 | 63% | 75% | 33% | $1.51 | 8.0m | 16M | ||
56 | 58% | 77% | 33% | $1.88 | 6.7m | 6.6M | ||
55 | 57% | 79% | 31% | $2.65 | 6.4m | 6.9M | ||
55 | 53% | 78% | 34% | $1.66 | 3.5m | 3.2M | ||
55 | 60% | 72% | 31% | $1.56 | 6.0m | 5.6M | ||
53 | 57% | 71% | 31% | $1.21 | 6.9m | 12.8M | ||
52 | 53% | 73% | 29% | $0.92 | 5.7m | 9.6M | ||
50 | 43% | 68% | 39% | $0.06 | 14.5m | 20.8M | ||
48 | 46% | 70% | 29% | $0.88 | 4.0m | 3.2M | ||
43 | 35% | 60% | 34% | $1.40 | 3.3m | 3.4M | ||
42 | 37% | 62% | 27% | $0.44 | 3.2m | 4.3M | ||
39 | 30% | 63% | 23% | $0.49 | 2.6m | 1.7M | ||
25 | 10% | 50% | 15% | $0.19 | 1.7m | 1.4M | ||
23 | 13% | 37% | 19% | $0.36 | 1.5m | 1.1M | ||
19 | 6% | 33% | 17% | $0.33 | 2.2m | 3.5M | ||
64 | 60% | 84% | 48% | $2.44 | 15.5m | 3.6M |
Leistung
Leistung im Artificial Analysis Coding Agent Index.
Artificial Analysis Coding Agent Index
Artificial Analysis Coding Agent Index v1.4 incorporates 3 benchmarks: DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA · Higher is better
Since benchmarking, we have observed a higher rate of content safety filtering on this endpoint.
Token-Nutzung
Token-Verbrauch im Artificial Analysis Coding Agent Index.
Token-Nutzung pro Aufgabe
Durchschnittliche Eingabe-, Cache- und Ausgabe-Tokens pro Aufgabe
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.
Artificial Analysis Coding Agent Index vs. Gesamt-Tokens
Artificial Analysis Coding Agent Index vs. durchschnittliche Gesamt-Tokens pro Aufgabe
Most attractive quadrant
Kosten
Pay-per-Token-API-Kosten im Artificial Analysis Coding Agent Index, basierend auf den aktuellen Preisen pro Token.
Kosten pro Aufgabe
Average pay-per-token API cost per task (USD) · Lower is better
Artificial Analysis Coding Agent Index vs. Kosten pro Aufgabe
Artificial Analysis Coding Agent Index vs. durchschnittliche Pay-per-Token-API-Kosten pro Aufgabe (USD)
Most attractive quadrant
Pareto line
Ausführungszeit
Aktive Agent-Laufzeit im Artificial Analysis Coding Agent Index.
Zeit pro Aufgabe
Average agent wall time per task · Lower is better
Artificial Analysis Coding Agent Index vs. Ausführungszeit
Artificial Analysis Coding Agent Index vs. durchschnittliche Agent-Laufzeit pro Aufgabe
Most attractive quadrant