Devin Fusion CLIとGrok Build

Devin Fusion CLIとGrok BuildをArtificial Analysis Coding Agent Indexのベンチマークスコア、コスト、実行時間、トークン使用量で比較します。

詳しい方法論は、方法論ページをご覧ください。

ほかの比較を見る
vs

ハイライト

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

比較

Devin Fusion CLI と Grok Build の並列比較。

コーディングエージェント比較

指標
Devin Fusion CLI
Claude Fable 5.1 XHigh + SWE-2 Medium
Grok Build
Grok 4.7 (xhigh)
分析
エージェントハーネス
Devin Fusion CLI
Grok Build
代表モデル
Claude Fable 5.1 XHigh + SWE-2 Medium
Grok 4.7 (xhigh)
Coding Agent Index
62
56
Devin Fusion CLI は Grok Build よりCoding Agent Indexが高いです
DeepSWE v1.1
63%
73%
Grok Build は Devin Fusion CLI より DeepSWE v1.1 のスコアが高いです
Terminal-Bench 4.0
56%
33%
Devin Fusion CLI は Grok Build より Terminal-Bench 4.0 のスコアが高いです
SWE-Atlas-QnA
66%
63%
Devin Fusion CLI は Grok Build より SWE-Atlas-QnA のスコアが高いです
タスクあたりのコスト
$7.90
$8.82
Devin Fusion CLI は Grok Build よりタスクあたりのコストが低いです
タスクあたりの時間
35.8m
39.2m
Devin Fusion CLI は Grok Build よりタスクあたりの時間が短いです
タスクあたりのターン数
99.5
162.6
Devin Fusion CLI は Grok Build よりタスクあたりのターン数が少ないです
タスクあたりのトークン使用量
969.2万
1432.5万
Devin Fusion CLI は Grok Build よりタスクあたりのトークン使用量が少ないです
キャッシュヒット率
96%
94%
Devin Fusion CLI は Grok Build よりキャッシュヒット率が高いです

モデルバリアント

Devin Fusion CLI と Grok Build の評価済みモデルバリアント。

モデルバリアント

Devin Fusion CLI
Claude Fable 5.1 XHigh + SWE-2 Medium
62
63%
56%
66%
$7.90
35.8m
969.2万
Devin Fusion CLI
GPT-6 Astra XHigh + SWE-2 Medium
59
67%
50%
59%
$4.54
24.7m
607.4万
Grok Build
Grok 4.7 (xhigh)
56
73%
33%
63%
$8.82
39.2m
1432.5万
Grok Build
Grok 4.6 (xhigh)
47
65%
18%
58%
$3.57
19.5m
554.4万

パフォーマンス

Artificial Analysis Coding Agent Indexにおけるパフォーマンス。

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. タスクあたりのコスト

Artificial Analysis Coding Agent Index vs. タスクあたりの平均トークン従量課金APIコスト(USD)
Most attractive quadrant

トークン使用量

Artificial Analysis Coding Agent Indexにおけるトークン消費量。

タスクあたりのトークン使用量

タスクあたりの入力・キャッシュ・出力トークンの平均
プロンプトキャッシュのヒット率はプロバイダーのルーティングによって大きく変わる可能性があり、実効コストに大きく影響することがあります。

Artificial Analysis Coding Agent Index vs. 合計トークン

Artificial Analysis Coding Agent Index vs. タスクあたりの平均合計トークン
Most attractive quadrant

コスト

現在のトークン単位の価格に基づく、Artificial Analysis Coding Agent Indexのトークン従量課金APIコスト。

タスクあたりのコスト

Average pay-per-token API cost per task (USD) · Lower is better

実行時間

Artificial Analysis Coding Agent Indexにおけるエージェントの実稼働時間。

タスクあたりの時間

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. 実行時間

Artificial Analysis Coding Agent Index vs. タスクあたりの平均エージェント稼働時間
Most attractive quadrant