Artificial Analysis 编程智能体基准测试

我们测量编程智能体在软件工程任务中的真实性能,包括成本、token 用量和执行时间。我们比较性能在不同智能体、模型和执行设置下的变化。

如需比较语言模型,请参阅我们的模型基准测试

Artificial Analysis Coding Agent Index

由 3 个基准测试组成的综合指数:

每个基准测试的分数是每个任务三次尝试的 pass@1 的平均值。指数对其 3 个基准测试组成部分赋予相同权重。有关评分细节和版本历史,请参阅方法论。

亮点

Updated
Artificial Analysis Coding Agent Index v1.5 · Higher is better
Average agent wall time per task · Lower is better
Average API cost per task (USD) · Lower is better

性能Updated

Artificial Analysis Coding Agent Index上的性能。

Artificial Analysis Coding Agent Index

Artificial Analysis Coding Agent Index v1.5 incorporates 3 benchmarks: DeepSWE v1.1, Terminal-Bench 4.0, and SWE-Atlas-QnA · Higher is better

Artificial Analysis Coding Agent Index vs. 每个任务的成本

Artificial Analysis Coding Agent Index vs. 每个任务的平均按 token 计费 API 成本(USD)
Most attractive quadrant
Pareto line

Harness 对比

即将推出

Token 用量

Artificial Analysis Coding Agent Index上的 token 消耗,包括总用量、token 构成、效率以及各基准测试的细分。

每个任务的 Token 用量

每个任务的平均输入、缓存和输出 token
Prompt cache hit rates can vary significantly by provider routing, which can materially change effective cost.

Artificial Analysis Coding Agent Index vs. 总 Token

Artificial Analysis Coding Agent Index vs. 每个任务的平均总 Token
Most attractive quadrant

成本

基于当前按 token 计费的 API 价格的 Artificial Analysis Coding Agent Index成本,在可用时包括缓存写入价格和缓存折扣。许多用户通过订阅套餐而非按 token 付费来使用编程智能体的 harness。

每个任务的成本

Average pay-per-token API cost per task (USD) · Lower is better

执行时间

Artificial Analysis Coding Agent Index上的智能体活跃运行时间。

每个任务的时间

Average agent wall time per task · Lower is better

Artificial Analysis Coding Agent Index vs. 执行时间

Artificial Analysis Coding Agent Index vs. 每个任务的平均智能体运行时间
Most attractive quadrant

常见问题