CodexとKimi Code CLI

CodexとKimi Code CLIをArtificial Analysis Coding Agent Indexのベンチマークスコア、コスト、実行時間、トークン使用量で比較します。

詳しい方法論は、方法論ページをご覧ください。

ほかの比較を見る
vs
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

比較

Codex と Kimi Code CLI の並列比較。

コーディングエージェント比較

指標
Codex
GPT-6.1 Sol (xhigh)
Kimi Code CLI
Kimi K3
分析
エージェントハーネス
Codex
Kimi Code CLI
代表モデル
GPT-6.1 Sol (xhigh)
Kimi K3
Coding Agent Index
63
52
Codex は Kimi Code CLI よりCoding Agent Indexが高いです
DeepSWE v1.1
73%
68%
Codex は Kimi Code CLI より DeepSWE v1.1 のスコアが高いです
Terminal-Bench 4.0
55%
21%
Codex は Kimi Code CLI より Terminal-Bench 4.0 のスコアが高いです
SWE-Atlas-QnA
61%
66%
Kimi Code CLI は Codex より SWE-Atlas-QnA のスコアが高いです
タスクあたりのコスト
$1.04
$5.05
Codex は Kimi Code CLI よりタスクあたりのコストが低いです
タスクあたりの時間
15.5m
1.0h
Codex は Kimi Code CLI よりタスクあたりの時間が短いです
タスクあたりのターン数
40.1
173.4
Codex は Kimi Code CLI よりタスクあたりのターン数が少ないです
タスクあたりのトークン使用量
321.3万
848.1万
Codex は Kimi Code CLI よりタスクあたりのトークン使用量が少ないです
キャッシュヒット率
93%
95%
Kimi Code CLI は Codex よりキャッシュヒット率が高いです

モデルバリアント

Codex と Kimi Code CLI の評価済みモデルバリアント。

モデルバリアント

Codex
GPT-6.1 Sol (xhigh)
63
73%
55%
61%
$1.04
15.5m
321.3万
Codex
GPT-6 Astra (max)
62
68%
56%
62%
$7.47
29.4m
334.7万
Codex
GPT-6.1 Sol (medium)
61
72%
52%
61%
$0.70
10.9m
229.8万
Codex
GPT-6.1 Sol (high)
60
71%
50%
60%
$0.89
13.3m
282万
Codex
GPT-6.1 Sol (max)
60
70%
53%
58%
$1.55
24.4m
400万
Codex
GPT-6.1 Sol (low)
57
68%
49%
55%
$0.50
8.6m
171.4万
Codex
GPT-6 Sol (max)
57
69%
43%
58%
$2.99
22.3m
984.1万
Codex
GPT-5.6 Sol (max)
55
72%
37%
54%
$6.35
20.6m
1017万
Codex
GPT-5.6 Luna (max)
43
66%
15%
49%
$0.44
23.5m
1485.5万
Codex
DeepSeek V4 Pro 0813 (max)
43
57%
10%
62%
$0.24
40.3m
2418万
Codex
GPT-6 Luna (max)
41
64%
15%
44%
$0.18
21.4m
1021.8万
Codex
DeepSeek V4 Flash 0731 (max)
39
54%
11%
51%
$0.09
18.3m
1535万
Kimi Code CLI
Kimi K3
52
68%
21%
66%
$5.05
1.0h
848.1万

パフォーマンス

Artificial Analysis Coding Agent Indexにおけるパフォーマンス。

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. タスクあたりのコスト

Artificial Analysis Coding Agent Index vs. タスクあたりの平均トークン従量課金APIコスト(USD)
Most attractive quadrant

トークン使用量

Artificial Analysis Coding Agent Indexにおけるトークン消費量。

タスクあたりのトークン使用量

タスクあたりの入力・キャッシュ・出力トークンの平均
プロンプトキャッシュのヒット率はプロバイダーのルーティングによって大きく変わる可能性があり、実効コストに大きく影響することがあります。

Artificial Analysis Coding Agent Index vs. 合計トークン

Artificial Analysis Coding Agent Index vs. タスクあたりの平均合計トークン
Most attractive quadrant

コスト

現在のトークン単位の価格に基づく、Artificial Analysis Coding Agent Indexのトークン従量課金APIコスト。

タスクあたりのコスト

Average pay-per-token API cost per task (USD) · Lower is better

実行時間

Artificial Analysis Coding Agent Indexにおけるエージェントの実稼働時間。

タスクあたりの時間

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. 実行時間

Artificial Analysis Coding Agent Index vs. タスクあたりの平均エージェント稼働時間
Most attractive quadrant