Claude Code vs. Codex
Vergleich von Claude Code und Codex im Artificial Analysis Coding Agent Index, einschließlich Benchmark-Werten, Kosten, Ausführungszeit und Tokenverbrauch.
Einzelheiten zu unserer Methodik finden Sie auf unserer Methodikseite.
Weitere Vergleiche entdecken
vs
Wichtigste Ergebnisse
Vergleich
Direkter Vergleich von Claude Code und Codex.
Programmieragenten-Vergleich
Metrik | Analyse | ||
|---|---|---|---|
Agent-Harness | Claude Code | Codex | |
Repräsentatives Modell | Opus 5 (xhigh) | GPT-5.6 Sol (max) | |
Coding Agent Index | 68 | 65 | Claude Code hat einen höheren Coding Agent Index als Codex |
DeepSWE | 60% | 69% | Codex hat einen höheren DeepSWE-Wert als Claude Code |
Terminal-Bench v2.1 | 89% | 83% | Claude Code hat einen höheren Terminal-Bench v2.1-Wert als Codex |
SWE-Atlas-QnA | 55% | 43% | Claude Code hat einen höheren SWE-Atlas-QnA-Wert als Codex |
Kosten pro Aufgabe | $8.17 | $6.42 | Codex hat geringere Kosten pro Aufgabe als Claude Code |
Zeit pro Aufgabe | 23.7m | 10.2m | Codex hat eine geringere Zeit pro Aufgabe als Claude Code |
Runden pro Aufgabe | 152.1 | 112.3 | Codex hat weniger Runden pro Aufgabe als Claude Code |
Token-Nutzung pro Aufgabe | 21.6M | 13.2M | Codex hat eine geringere Token-Nutzung pro Aufgabe als Claude Code |
Cache-Trefferquote | 97% | 90% | Claude Code hat eine höhere Cache-Trefferquote als Codex |
Modellvarianten
Bewertete Modellvarianten für Claude Code und Codex.
Modellvarianten
68 | 60% | 89% | 55% | $8.17 | 23.7m | 21.6M | ||
67 | 66% | 87% | 49% | $11.69 | 23.5m | 13.9M | ||
67 | 63% | 89% | 49% | $8.94 | 24.2m | 23.7M | ||
66 | 61% | 87% | 49% | $3.92 | 14.0m | 9.9M | ||
64 | 63% | 85% | 44% | $3.17 | 12.2m | 8M | ||
62 | 56% | 84% | 47% | $7.72 | 23.1m | 17.9M | ||
61 | 52% | 84% | 48% | $3.23 | 29.9m | 12.5M | ||
59 | 57% | 82% | 39% | $2.30 | 10.0m | 5.3M | ||
59 | 51% | 83% | 43% | $5.67 | 17.8m | 13.6M | ||
58 | 52% | 82% | 39% | $3.78 | 12.7m | 9.2M | ||
56 | 49% | 82% | 36% | $3.30 | 12.0m | 7.8M | ||
52 | 40% | 78% | 37% | $5.92 | 15.8m | 16.1M | ||
49 | 41% | 78% | 28% | $2.18 | 8.6m | 5.2M | ||
43 | 29% | 72% | 29% | $6.66 | 25.1m | 6.6M | ||
42 | 27% | 77% | 23% | $1.80 | 6.7m | 4.6M | ||
39 | 29% | 67% | 20% | $2.04 | 13.8m | 8.4M | ||
38 | 19% | 72% | 24% | $6.30 | 10.7m | 8.8M | ||
37 | 19% | 67% | 25% | $4.28 | 19.0m | 25.8M | ||
34 | 17% | 69% | 16% | $1.22 | 40.7m | 11.7M | ||
33 | 9% | 70% | 20% | $0.25 | 17.9m | 9.9M | ||
65 | 69% | 83% | 43% | $6.42 | 10.2m | 13.2M | ||
64 | 65% | 82% | 45% | $3.85 | 6.2m | 8M | ||
63 | 67% | 80% | 43% | $4.80 | 7.3m | 9.9M | ||
62 | 64% | 81% | 40% | $2.81 | 5.0m | 5.8M | ||
61 | 64% | 83% | 36% | $4.75 | 10.2m | 12.2M | ||
60 | 67% | 78% | 36% | $2.70 | 8.2m | 9.6M | ||
57 | 63% | 75% | 33% | $1.51 | 8.0m | 16M | ||
56 | 58% | 77% | 33% | $1.88 | 6.7m | 6.6M | ||
55 | 57% | 79% | 31% | $2.65 | 6.4m | 6.9M | ||
55 | 53% | 78% | 34% | $1.66 | 3.5m | 3.2M | ||
55 | 60% | 72% | 31% | $1.56 | 6.0m | 5.6M | ||
53 | 57% | 71% | 31% | $1.21 | 6.9m | 12.8M | ||
52 | 53% | 73% | 29% | $0.92 | 5.7m | 9.6M | ||
50 | 43% | 68% | 39% | $0.06 | 14.5m | 20.8M | ||
48 | 46% | 70% | 29% | $0.88 | 4.0m | 3.2M | ||
43 | 35% | 60% | 34% | $1.40 | 3.3m | 3.4M | ||
42 | 37% | 62% | 27% | $0.44 | 3.2m | 4.3M | ||
39 | 30% | 63% | 23% | $0.49 | 2.6m | 1.7M | ||
25 | 10% | 50% | 15% | $0.19 | 1.7m | 1.4M | ||
23 | 13% | 37% | 19% | $0.36 | 1.5m | 1.1M | ||
19 | 6% | 33% | 17% | $0.33 | 2.2m | 3.5M |
Leistung
Leistung im Artificial Analysis Coding Agent Index.
Artificial Analysis Coding Agent Index
Artificial Analysis Coding Agent Index v1.4 incorporates 3 benchmarks: DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA · Higher is better
Since benchmarking, we have observed a higher rate of content safety filtering on this endpoint.
Token-Nutzung
Token-Verbrauch im Artificial Analysis Coding Agent Index.
Token-Nutzung pro Aufgabe
Durchschnittliche Eingabe-, Cache- und Ausgabe-Tokens pro Aufgabe
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.
Artificial Analysis Coding Agent Index vs. Gesamt-Tokens
Artificial Analysis Coding Agent Index vs. durchschnittliche Gesamt-Tokens pro Aufgabe
Most attractive quadrant
Kosten
Pay-per-Token-API-Kosten im Artificial Analysis Coding Agent Index, basierend auf den aktuellen Preisen pro Token.
Kosten pro Aufgabe
Average pay-per-token API cost per task (USD) · Lower is better
Artificial Analysis Coding Agent Index vs. Kosten pro Aufgabe
Artificial Analysis Coding Agent Index vs. durchschnittliche Pay-per-Token-API-Kosten pro Aufgabe (USD)
Most attractive quadrant
Pareto line
Ausführungszeit
Aktive Agent-Laufzeit im Artificial Analysis Coding Agent Index.
Zeit pro Aufgabe
Average agent wall time per task · Lower is better
Artificial Analysis Coding Agent Index vs. Ausführungszeit
Artificial Analysis Coding Agent Index vs. durchschnittliche Agent-Laufzeit pro Aufgabe
Most attractive quadrant