AA-AgentPerfの方法論

概要

AA-AgentPerfは、現実的なエージェント型ワークロードにおいて、エージェントごとの速度目標を達成しながら推論環境がサポートできるアクティブなエージェント数を測定するハードウェアベンチマークです。

  • 実際のエージェント軌跡 — 推論、ツール呼び出し、可変長のコンテキストを交互に含むマルチターンのコーディングセッション(合成された均一なプロンプトではありません)。
  • 持続的な同時実行負荷 — シミュレートしたエージェントが処理中のリクエストを継続的に維持し、KVキャッシュの再利用、投機的デコーディング、スケジューラーの動作に負荷をかけます。
  • 市場データに基づくSLO階層 — Artificial AnalysisのサーバーレスAPIベンチマークデータに基づく性能しきい値で、各プロバイダーで観測されたサービス品質の水準を反映しています。
  • 継続的な更新 — 新しいハードウェア、ソフトウェアスタック、モデルバージョンが利用可能になるたびに、結果を継続的に更新します。
  • 本番環境に対応 — 現実的な最適化を有効にし、本番規模のデプロイ構成でモデルをテストします。
concurrent agents0/ 9INFERENCESYSTEMAGENT 1AGENT 2AGENT 3AGENT 4AGENT 5AGENT 6AGENT 7AGENT 8AGENT 9system throughputoutput speed per agent

シミュレートした各エージェントは、推論、ツールの呼び出し、コードの編集を行いながら、エージェント型コーディングの軌跡を順番に処理します。同時に、システムは増加する同時実行数に対応できるようスケールします。

データセット

AA-AgentPerfデータセットには、複数のユースケース、プログラミング言語、モデルを網羅した実際のエージェント軌跡が含まれています。軌跡は、推論を有効にした主要な3つのオープンソースモデル(DeepSeek V3.2、GLM 4.7、Kimi K2.5)をOpenCodeエージェントハーネスで使用し、実在する公開コードリポジトリの課題を解決するよう指示して生成しました。すべての軌跡に、交互に行われる推論とツール呼び出しが含まれます。

  • 入力シーケンス長(ISL):約5K~約131Kトークンで、平均は約27Kトークンです。軌跡は、テスト対象モデルで推奨される最大コンテキスト長に収まるよう切り詰めます。
  • 出力シーケンス長(OSL):出力長はターンごとに大きく異なります。単純なツール呼び出しなど短い出力を生成するターンもあれば、モデルが応答または処理を行う前に長い推論を伴うターンもあります。
  • 言語:ソースリポジトリの主要言語を基準に、12以上のプログラミング言語が含まれています。Pythonのリポジトリが最も多く、TypeScript、Goが続きます。
  • ツール呼び出しの遅延:各ツール呼び出しの後に、呼び出したツール別に分けた実際のツール呼び出し時間の分布からサンプリングした、メッセージごとの固定遅延によって処理時間をシミュレートします。遅延は0.1秒未満から5秒までで、中央値は約1秒です。

構成の検証と性能チューニングのため、18,997件のプロンプトからなる500件の固有軌跡を代表的なチューニング用サブセットとしてテスト参加者に提供します。ベンチマークに特化した最適化を防ぐため、完全なテストデータセットは非公開としています。

サービスレベル目標

性能SLOは、Artificial AnalysisのサーバーレスAPIベンチマークデータに基づいて決定します。テスト対象の各モデルについて、現在市場で提供されているサービス階層を特定しています。ベンダーは各階層を個別に目標とし、そのサービス水準でサポートできる同時実行エージェント数を最大化します。

速度と遅延はいずれも、リクエスト単位で計算します。エージェント型ワークロードにはOSLの短いリクエストが多数含まれるため、P25出力速度を使用し、各フェーズで送信された全リクエストからパーセンタイルを計算します。

各モデルは、開発元が推奨するサンプリングパラメーターと、利用可能な最大の思考強度でテストします。DeepSeek V4 ProとKimi K3ではmax reasoning effort、gpt-oss-120bではhigh reasoning effortを使用し、その他のすべてのパラメーターはデフォルトに設定します。

現在、個別の出力速度とTTFTの指標から、両者を統合したE2E速度の指標へ移行しています。移行期間中は、一部の統計を速度/TTFTで、その他をE2E速度で示します。

モデルSLO階層P25出力速度(トークン/秒)P95 TTFT(秒)
DeepSeek V4 Pro (max)SLO #12010
SLO #2605
SLO #31803
gpt-oss-120b (high)SLO #11005
SLO #22503
SLO #35002
SLO #42,0001
Kimi K3 (max)Kimi K3では、SLOを使用せず、完全なパレートフロンティアに焦点を当てた新しい構成を試験しています

性能SLO

テストの実行

各SLOでサポート可能なエージェント数は、最初に指数関数的に負荷を増加させた後、二分探索で決定します。指標は、定常状態におけるトークンのタイミング情報から計算します。フェーズが完了して指標を計算すると、システムはSLO違反の有無を判定し、次の目標同時実行数に進みます。各フェーズは、少なくとも30件の軌跡が完了し、シミュレートしたすべてのエージェントが少なくとも3件の軌跡を完了し、定常状態での測定時間が少なくとも10分経過するまで実行します。エージェントへの軌跡の割り当てはフェーズ間で決定論的です。各フェーズでは軌跡の先頭に動的に生成したプレフィックスを追加し、フェーズ間でのプレフィックスキャッシュを無効にします。max_tokensを16Kに設定することで、モデルが反復ループに陥った個別のリクエストによって結果が歪むのを防ぎます。

RAMPdoubling the load until a target breaks
0100200300400048121620concurrent agentsp25 output speed (t/s)SLO threshold (100 t/s)max = 11
PhaseAgentsp25 SpeedResult
max agents = 11

同時実行エージェント数が増えると、リクエストごとの出力速度は低下します。各SLO階層は許容可能な最低速度を定め、その階層でサポートできるエージェントの最大数を決定します。

指標と結果

各テストフェーズでは、次のタイミング指標を計算します。

  • 最初のトークンまでの時間(TTFT):リクエストの送信から最初の出力トークンを受信するまでの、リクエスト単位の遅延。
  • 出力速度:最初のトークンを受信した後に測定する、リクエスト単位の1秒あたりの出力トークン数。
  • E2E速度:最初のトークンを待つ時間を含むリクエスト全体での、リクエスト単位の1秒あたりの出力トークン数。この単一の指標が上記2つに代わります。
  • システム出力スループット:同時実行中の全エージェントを合計した1秒あたりの出力トークン数。

すべての指標は、目標同時実行数において全エージェントが少なくとも30秒間アクティブだった定常状態の期間に限定します。速度指標には、推論フレームワークが返す使用状況メタデータのサーバー側トークン数を使用し、候補モデルのネイティブトークナイザーによるローカルでのトークン化と照合します。稼働中のテストでは、各アクセラレーターの消費電力を測定します。主要な結果である各SLO階層での最大同時実行エージェント数と出力スループットは、ハードウェア構成を公平に比較できるよう、アクセラレーターあたり、およびMWあたりに正規化します。MWあたりの数値には、定格TDPではなく、負荷時に測定したアクセラレーターの消費電力(GPUダイ + HBM)を使用します。

結果は、プロバイダーが開示した完全なシステム構成とともに、Artificial Analysisのリーダーボードで公開します。プロバイダーは公開前に、事実関係の正確性を確認するため結果をレビューできます。

評価申請

AA-AgentPerfの評価にシステムを提供することに関心があり、まだ当社と連絡を取っていないハードウェアベンダーの方は、agentperf@artificialanalysis.aiまでご連絡ください。