Artificial Analysis コーディングエージェントベンチマーク
ソフトウェアエンジニアリングタスクにおけるコーディングエージェントの実環境でのパフォーマンスを、コスト、トークン使用量、実行時間を含めて測定します。エージェント、モデル、実行設定によってパフォーマンスがどう変わるかを比較します。
言語モデルを比較するには、モデルベンチマークをご覧ください。
Artificial Analysis Coding Agent Index
3 件のベンチマークの複合指数:
- DeepSWE v1.1Software engineering tasks, 113 tasks
- Terminal-Bench 4.0Agentic terminal use, 66 tasks
- SWE-Atlas-QnATechnical Q&A, 124 tasks
各ベンチマークのスコアは、タスクごとに3回の試行の pass@1 を平均したものです。指数はその 3 件のベンチマーク構成要素に均等な重みを与えます。スコアリングの詳細とバージョン履歴については方法論をご覧ください。
ハイライト
パフォーマンスUpdated
Artificial Analysis Coding Agent Indexにおけるパフォーマンス。
Artificial Analysis Coding Agent Index
Artificial Analysis Coding Agent Index vs. タスクあたりのコスト
ハーネス比較
近日公開
トークン使用量
Artificial Analysis Coding Agent Indexにおけるトークン消費量。合計使用量、トークン構成、効率、ベンチマークごとの内訳を含みます。
タスクあたりのトークン使用量
Artificial Analysis Coding Agent Index vs. 合計トークン
コスト
現在のトークン単位のAPI料金に基づく Artificial Analysis Coding Agent Indexのコスト。利用可能な場合はキャッシュ書き込み料金やキャッシュ割引を含みます。多くのユーザーはトークン従量課金ではなくサブスクリプションプランを通じてコーディングエージェントのハーネスを利用します。
タスクあたりのコスト
実行時間
Artificial Analysis Coding Agent Indexにおけるエージェントの実稼働時間。
タスクあたりの時間
Artificial Analysis Coding Agent Index vs. 実行時間
よくある質問
Artificial Analysis Coding Agent Indexは、このページの公開ベンチマークスイート全体におけるコーディングエージェントのパフォーマンスの複合スコアです。DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA を組み合わせて、実装、ターミナルワークフロー、リポジトリ理解、より広範なソフトウェアエンジニアリングのパフォーマンスを一つの主要指標として捉えます。
現在の公開指数には DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA が含まれます。これらのベンチマークは、同じタスク形式を繰り返すのではなく、コーディングエージェントのワークフローの異なる部分に負荷をかけるため、組み合わせられています。
公開ベンチマークスイートは、いくつかのソフトウェアエンジニアリングのタスクスタイルを組み合わせています。一部は、コードベースを読み、アーキテクチャや動作を理解し、正しい技術的回答を導き出すことに焦点を当てたQ&Aおよびリポジトリ理解タスクです。一部は、コード変更を必要とし、動作するパッチを作成するという古典的な枠組みに近い実装およびバグ修正タスクです。一部は、エージェントがシェル駆動の環境を操作し、ツールを正しく実行し、複数ステップのコマンドラインワークフローを完了できるかをテストするターミナルワークフロータスクです。現在の3つのベンチマークはすべて二値のタスク結果を用います。
Q&A形式のタスクは、リポジトリの理解、コードの読解、動作の追跡、正しい技術的説明の作成を重視します。実装形式のタスクは、動作する変更を提供することにより近いものです。エージェントはタスクを理解し、リポジトリを操作し、ファイルを正しく編集し、実行制約の下で評価者またはテストベースの結果を満たす必要があります。これらは関連する能力ですが、同一ではありません。エージェントはリポジトリの推論に強くても、信頼性の高いパッチ実行では弱いことがあり、その逆もあり得ます。これが、複合指数をベンチマークごとのグラフと併せて解釈すべき理由の一つです。
ベンチマークページは、タスク正規化された平均 pass@1 を報告します。各ベンチマークについて、まず各タスクの3回の評価済み試行を平均し、次にそのタスクレベルのスコアを平均して、すべてのタスクが均等な重みを持つようにします。現在の構成要素の結果はすべて二値です。試行が問題なく完了しても、検証者を満たさない場合はゼロ点になることがあります。SWE-Atlas-QnA の二値の合格/不合格採点は、Scale AI の Task Resolve Rate 方法論に沿っています。
指数は DeepSWE v1.1、Terminal-Bench 4.0、SWE-Atlas-QnA から計算されます。現在の Artificial Analysis Coding Agent Indexでは、公開されている方法論はそれらのベンチマークスコアの単純平均です。ベンチマークの方法論はカバレッジの向上とともに進化しうるため、比較可能性は、時代を超えた絶対スコアとしてではなく、公開されたベンチマークスイートと現在の構成要素セットの中で解釈するのが最適です。
このページの実行時間は、単なるモデルのレイテンシではなく、タスクあたりの平均実時間ランタイムを指します。エージェントのワークフロー全体を実行する際の、ユーザーが体感する時間コストを反映することを目的としています。これには、推論、ツール呼び出しの発行、ファイルの読み書き、シェルステップの実行、モデル応答の待機に費やされる時間が含まれます。したがって、エージェントは高速な基盤モデルを持っていても、ワークフローがより長かったりツールをより多く使ったりする場合は、全体として遅くなることがあります。
トークン使用量は、ベンチマークスイート全体でのタスクあたりの平均観測トークン消費量です。このページでは、入力、キャッシュ、出力トークンに分けています。入力トークンは、プロンプト、指示、ツールコンテキスト、タスクコンテキストを含む、モデルに送られるトークンです。キャッシュトークンは、プロバイダーがそのテレメトリを公開している場合に、プロンプトキャッシュによって再利用されるプロンプトトークンです。出力トークンは、モデルが応答で生成するトークンです。トークン使用量は、しばしばコストを左右し、エージェントが作業を行うために消費するコンテキストの量も示しうるため重要ですが、プロバイダーがトークンのカテゴリごとに異なる価格を設定し、キャッシュが請求額を大きく変えうるため、トークン効率とコストは同一ではありません。
指数スコアが高いほど、含まれるベンチマークの組み合わせ全体で高いパフォーマンスを意味しますが、そのエージェントがあらゆるワークフローに最適であることを意味するわけではありません。指数はベンチマーク品質のバランスであり、レイテンシ、コスト、ツール、タスクタイプに関するあなた固有の優先事項を直接測定するものではありません。実際の選択は、ワークフローがリポジトリQ&A、パッチ適用、ターミナル実行のどれに近いか、そしてIDE統合、モデルの利用可能性、信頼性といった実務的な制約に依然として左右されます。
これらのベンチマークは、リポジトリ、ツール、複数ステップのワークフロー、評価者ベースの結果にわたるコーディングエージェントのパフォーマンスを測定します。このページの結果は、単なる汎用的な製品名ではなく、評価された特定のエージェントバリアントを反映しています。モデルの選択、設定、実行構成は結果を大きく変えうるため、同一のエージェントファミリーが結果に複数のバリアントとして現れることがあります。ベンチマークの実行、タスクレベルの採点、方法論の詳細については、コーディングエージェントのベンチマーキング方法論ページをご覧ください。 コーディングエージェントのベンチマーキング方法論を見る