Programmieragenten-Benchmarks von Artificial Analysis

Wir messen die reale Leistung von Programmieragenten bei Software-Engineering-Aufgaben, einschließlich Kosten, Token-Nutzung und Ausführungszeit. Wir vergleichen, wie sich die Leistung über Agents, Modelle und Ausführungseinstellungen hinweg verändert.

Sprachmodelle können Sie in unseren Modell-Benchmarks vergleichen.

Artificial Analysis Coding Agent Index

Zusammengesetzter Index aus 3 Benchmarks:

Jeder Benchmark-Wert mittelt pass@1 über drei Versuche pro Aufgabe. Der Index gewichtet seine 3 Benchmark-Komponenten gleich. Details zur Bewertung und zum Versionsverlauf finden Sie in der Methodik.

Wichtigste Ergebnisse

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

LeistungUpdated

Leistung im Artificial Analysis Coding Agent Index.

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. Kosten pro Aufgabe

Artificial Analysis Coding Agent Index vs. durchschnittliche Pay-per-Token-API-Kosten pro Aufgabe (USD)
Most attractive quadrant
Pareto line

Harness-Vergleich

Demnächst verfügbar

Token-Nutzung

Token-Verbrauch im Artificial Analysis Coding Agent Index, einschließlich Gesamtnutzung, Token-Verteilung, Effizienz und Aufschlüsselungen pro Benchmark.

Token-Nutzung pro Aufgabe

Durchschnittliche Eingabe-, Cache- und Ausgabe-Tokens pro Aufgabe
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Artificial Analysis Coding Agent Index vs. Gesamt-Tokens

Artificial Analysis Coding Agent Index vs. durchschnittliche Gesamt-Tokens pro Aufgabe
Most attractive quadrant

Kosten

Kosten im Artificial Analysis Coding Agent Index basierend auf den aktuellen API-Preisen pro Token, einschließlich Cache-Schreibpreisen und Cache-Rabatten, sofern verfügbar. Viele Nutzer greifen über Abo-Angebote statt über Pay-per-Token auf Programmieragenten-Harnesses zu.

Kosten pro Aufgabe

Average pay-per-token API cost per task (USD) · Lower is better

Ausführungszeit

Aktive Agent-Laufzeit im Artificial Analysis Coding Agent Index.

Zeit pro Aufgabe

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. Ausführungszeit

Artificial Analysis Coding Agent Index vs. durchschnittliche Agent-Laufzeit pro Aufgabe
Most attractive quadrant

Häufig gestellte Fragen