Artificial Analysis コーディングエージェントベンチマーク

ソフトウェアエンジニアリングタスクにおけるコーディングエージェントの実環境でのパフォーマンスを、コスト、トークン使用量、実行時間を含めて測定します。エージェント、モデル、実行設定によってパフォーマンスがどう変わるかを比較します。

言語モデルを比較するには、モデルベンチマークをご覧ください。

Artificial Analysis Coding Agent Index

3 件のベンチマークの複合指数:

各ベンチマークのスコアは、タスクごとに3回の試行の pass@1 を平均したものです。指数はその 3 件のベンチマーク構成要素に均等な重みを与えます。スコアリングの詳細とバージョン履歴については方法論をご覧ください。

ハイライト

Artificial Analysis Coding Agent Index v1.4 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

パフォーマンス

Artificial Analysis Coding Agent Indexにおけるパフォーマンス。

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.4 incorporates 3 benchmarks: DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA · Higher is better
Since benchmarking, we have observed a higher rate of content safety filtering on this endpoint.

The Artificial Analysis Coding Agent Index is a composite score built from DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA.

It is useful for quick comparison, but it should be read alongside the per-eval breakdowns. Two agents with similar index values can still have different strengths across repository tasks, terminal workflows, and rubric-based evaluations.

ハーネス比較

Claude Opus 4.7 のハーネス別 Artificial Analysis Coding Agent Index。

ハーネス比較:Artificial Analysis Coding Agent Index

Composite average pass@1 across Claude Code, Cursor CLI, and Opencode for Claude Opus 4.7 · Higher is better

This chart holds the underlying model constant at Claude Opus 4.7 and compares how it performs across different coding-agent harnesses, including Cursor, Claude Code, and OpenCode.

トークン使用量

Artificial Analysis Coding Agent Indexにおけるトークン消費量。合計使用量、トークン構成、効率、ベンチマークごとの内訳を含みます。

タスクあたりのトークン使用量

タスクあたりの入力・キャッシュ・出力トークンの平均
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Non-cached input tokens sent to the model, including prompts, instructions, tool context, and task context that were not served from prompt cache.

Artificial Analysis Coding Agent Index vs. 合計トークン

Artificial Analysis Coding Agent Index vs. タスクあたりの平均合計トークン
Most attractive quadrant

Each point represents a coding-agent variant. Farther left means lower average total token usage per task, while higher on the chart means higher benchmark performance. Agents toward the upper-left achieve stronger results with fewer tokens.

コスト

現在のトークン単位のAPI料金に基づく Artificial Analysis Coding Agent Indexのコスト。利用可能な場合はキャッシュ書き込み料金やキャッシュ割引を含みます。多くのユーザーはトークン従量課金ではなくサブスクリプションプランを通じてコーディングエージェントのハーネスを利用します。

タスクあたりのコスト

Average pay-per-token API cost per task (USD) · Lower is better

This chart shows the average pay-per-token API cost per task across the Artificial Analysis Coding Agent Index, spanning DeepSWE, Terminal-Bench v2.1, and SWE-Atlas-QnA.

Where applicable, that cost model includes standard input pricing, discounted cached-input pricing, separate cache-write charges, and output pricing rather than treating all prompt tokens as if they were billed at the same uncached input rate.

It is intended to show pay-per-token API cost, not consumer plan pricing or the full operational cost of deploying the system in production. Infrastructure, engineering, and supervision costs are not the focus of this metric.

Artificial Analysis Coding Agent Index vs. タスクあたりのコスト

Artificial Analysis Coding Agent Index vs. タスクあたりの平均トークン従量課金APIコスト(USD)
Most attractive quadrant
Pareto line

Each point represents a coding-agent variant. Farther left means lower average cost per task, while higher on the chart means higher benchmark performance. The most efficient agents sit toward the upper-left: stronger results at lower cost.

実行時間

Artificial Analysis Coding Agent Indexにおけるエージェントの実稼働時間。

タスクあたりの時間

Average agent wall time per task · Lower is better

This chart uses agent wall time: how long the agent process was actively running on each task.

It does not include environment startup, verifier or judge time, or other harness overhead, so it is a cleaner comparison of how long the agent itself was working.

Artificial Analysis Coding Agent Index vs. 実行時間

Artificial Analysis Coding Agent Index vs. タスクあたりの平均エージェント稼働時間
Most attractive quadrant

Each point represents a coding-agent variant. Farther left means shorter average agent runtime per task, while higher on the chart means higher benchmark performance. Agents toward the upper-left deliver stronger results in less active agent time.

よくある質問

Artificial Analysis Coding Agent Indexは、このページの公開ベンチマークスイート全体におけるコーディングエージェントのパフォーマンスの複合スコアです。DeepSWE、Terminal-Bench v2.1、SWE-Atlas-QnA を組み合わせて、実装、ターミナルワークフロー、リポジトリ理解、より広範なソフトウェアエンジニアリングのパフォーマンスを一つの主要指標として捉えます。

現在の公開指数には DeepSWE、Terminal-Bench v2.1、SWE-Atlas-QnA が含まれます。これらのベンチマークは、同じタスク形式を繰り返すのではなく、コーディングエージェントのワークフローの異なる部分に負荷をかけるため、組み合わせられています。

公開ベンチマークスイートは、いくつかのソフトウェアエンジニアリングのタスクスタイルを組み合わせています。一部は、コードベースを読み、アーキテクチャや動作を理解し、正しい技術的回答を導き出すことに焦点を当てたQ&Aおよびリポジトリ理解タスクです。一部は、コード変更を必要とし、動作するパッチを作成するという古典的な枠組みに近い実装およびバグ修正タスクです。一部は、エージェントがシェル駆動の環境を操作し、ツールを正しく実行し、複数ステップのコマンドラインワークフローを完了できるかをテストするターミナルワークフロータスクです。現在の3つのベンチマークはすべて二値のタスク結果を用います。

Q&A形式のタスクは、リポジトリの理解、コードの読解、動作の追跡、正しい技術的説明の作成を重視します。実装形式のタスクは、動作する変更を提供することにより近いものです。エージェントはタスクを理解し、リポジトリを操作し、ファイルを正しく編集し、実行制約の下で評価者またはテストベースの結果を満たす必要があります。これらは関連する能力ですが、同一ではありません。エージェントはリポジトリの推論に強くても、信頼性の高いパッチ実行では弱いことがあり、その逆もあり得ます。これが、複合指数をベンチマークごとのグラフと併せて解釈すべき理由の一つです。

ベンチマークページは、タスク正規化された平均 pass@1 を報告します。各ベンチマークについて、まず各タスクの3回の評価済み試行を平均し、次にそのタスクレベルのスコアを平均して、すべてのタスクが均等な重みを持つようにします。現在の構成要素の結果はすべて二値です。試行が問題なく完了しても、検証者を満たさない場合はゼロ点になることがあります。SWE-Atlas-QnA の二値の合格/不合格採点は、Scale AI の Task Resolve Rate 方法論に沿っています。

指数は DeepSWE、Terminal-Bench v2.1、SWE-Atlas-QnA から計算されます。現在の Artificial Analysis Coding Agent Indexでは、公開されている方法論はそれらのベンチマークスコアの単純平均です。ベンチマークの方法論はカバレッジの向上とともに進化しうるため、比較可能性は、時代を超えた絶対スコアとしてではなく、公開されたベンチマークスイートと現在の構成要素セットの中で解釈するのが最適です。

このページの実行時間は、単なるモデルのレイテンシではなく、タスクあたりの平均実時間ランタイムを指します。エージェントのワークフロー全体を実行する際の、ユーザーが体感する時間コストを反映することを目的としています。これには、推論、ツール呼び出しの発行、ファイルの読み書き、シェルステップの実行、モデル応答の待機に費やされる時間が含まれます。したがって、エージェントは高速な基盤モデルを持っていても、ワークフローがより長かったりツールをより多く使ったりする場合は、全体として遅くなることがあります。

トークン使用量は、ベンチマークスイート全体でのタスクあたりの平均観測トークン消費量です。このページでは、入力、キャッシュ、出力トークンに分けています。入力トークンは、プロンプト、指示、ツールコンテキスト、タスクコンテキストを含む、モデルに送られるトークンです。キャッシュトークンは、プロバイダーがそのテレメトリを公開している場合に、プロンプトキャッシュによって再利用されるプロンプトトークンです。出力トークンは、モデルが応答で生成するトークンです。トークン使用量は、しばしばコストを左右し、エージェントが作業を行うために消費するコンテキストの量も示しうるため重要ですが、プロバイダーがトークンのカテゴリごとに異なる価格を設定し、キャッシュが請求額を大きく変えうるため、トークン効率とコストは同一ではありません。

指数スコアが高いほど、含まれるベンチマークの組み合わせ全体で高いパフォーマンスを意味しますが、そのエージェントがあらゆるワークフローに最適であることを意味するわけではありません。指数はベンチマーク品質のバランスであり、レイテンシ、コスト、ツール、タスクタイプに関するあなた固有の優先事項を直接測定するものではありません。実際の選択は、ワークフローがリポジトリQ&A、パッチ適用、ターミナル実行のどれに近いか、そしてIDE統合、モデルの利用可能性、信頼性といった実務的な制約に依然として左右されます。

これらのベンチマークは、リポジトリ、ツール、複数ステップのワークフロー、評価者ベースの結果にわたるコーディングエージェントのパフォーマンスを測定します。このページの結果は、単なる汎用的な製品名ではなく、評価された特定のエージェントバリアントを反映しています。モデルの選択、設定、実行構成は結果を大きく変えうるため、同一のエージェントファミリーが結果に複数のバリアントとして現れることがあります。ベンチマークの実行、タスクレベルの採点、方法論の詳細については、コーディングエージェントのベンチマーキング方法論ページをご覧ください。 コーディングエージェントのベンチマーキング方法論を見る