Artificial Analysis コーディングエージェントベンチマーク

ソフトウェアエンジニアリングタスクにおけるコーディングエージェントの実環境でのパフォーマンスを、コスト、トークン使用量、実行時間を含めて測定します。エージェント、モデル、実行設定によってパフォーマンスがどう変わるかを比較します。

言語モデルを比較するには、モデルベンチマークをご覧ください。

Artificial Analysis Coding Agent Index

3 件のベンチマークの複合指数:

各ベンチマークのスコアは、タスクごとに3回の試行の pass@1 を平均したものです。指数はその 3 件のベンチマーク構成要素に均等な重みを与えます。スコアリングの詳細とバージョン履歴については方法論をご覧ください。

ハイライト

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

パフォーマンスUpdated

Artificial Analysis Coding Agent Indexにおけるパフォーマンス。

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. タスクあたりのコスト

Artificial Analysis Coding Agent Index vs. タスクあたりの平均トークン従量課金APIコスト(USD)
Most attractive quadrant
Pareto line

ハーネス比較

近日公開

トークン使用量

Artificial Analysis Coding Agent Indexにおけるトークン消費量。合計使用量、トークン構成、効率、ベンチマークごとの内訳を含みます。

タスクあたりのトークン使用量

タスクあたりの入力・キャッシュ・出力トークンの平均
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Artificial Analysis Coding Agent Index vs. 合計トークン

Artificial Analysis Coding Agent Index vs. タスクあたりの平均合計トークン
Most attractive quadrant

コスト

現在のトークン単位のAPI料金に基づく Artificial Analysis Coding Agent Indexのコスト。利用可能な場合はキャッシュ書き込み料金やキャッシュ割引を含みます。多くのユーザーはトークン従量課金ではなくサブスクリプションプランを通じてコーディングエージェントのハーネスを利用します。

タスクあたりのコスト

Average pay-per-token API cost per task (USD) · Lower is better

実行時間

Artificial Analysis Coding Agent Indexにおけるエージェントの実稼働時間。

タスクあたりの時間

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. 実行時間

Artificial Analysis Coding Agent Index vs. タスクあたりの平均エージェント稼働時間
Most attractive quadrant

よくある質問