Coding Agent Index 方法论

概述

Artificial Analysis 对编程智能体进行端到端软件工程任务的基准测试。我们衡量智能体完成真实编程工作的能力,以及其在结果、可靠性、token 用量、成本和执行时间等方面的表现差异。

Coding Agent Index 页面上的公开结果基于任务级别的基准测试尝试,并汇总为单项评测得分、汇总效率指标以及 Artificial Analysis Coding Agent Index。

本页面重点介绍公开的 Artificial Analysis Coding Agent Index 的构建方式、当前包含的基准测试组件,以及公开的 pass@1、成本、token 用量和执行时间指标的计算方法。

Artificial Analysis Coding Agent Index

当前公开的 Artificial Analysis Coding Agent Index 是一项综合基准测试分数,由公开编程智能体套件中已配置的基准测试组件构建而成。

不同的编程智能体在仓库问答、实现与修复缺陷任务以及重度终端操作工作流上的表现可能差异很大。该指数将这些基准测试族汇总为一个顶层性能视图,同时在其下保留各项基准测试的详细拆分。

Coding Agent Index v1.5 是 DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 得分的等权平均值。

指数组件

当前公开指数包含以下基准测试组件:

评测领域任务每任务尝试次数响应类型评分
DeepSWE v1.1长周期软件工程1133代码补丁 / 仓库变更程序验证器 pass/fail,pass@1
Terminal-Bench 4.0智能体终端操作663基于终端的任务执行测试套件 pass/fail,pass@1
SWE-Atlas-QnA仓库问答1243开放式回答Scale AI Task Resolve Rate(二元 pass/fail),pass@1
DeepSWE v1.1
需要修改现有代码仓库的长程软件工程任务。v1.1 保留了与 v1.0 相同的 113 项任务,更新了执行环境,并在独立的验证环境中评估通过 commit 提交的补丁。在智能体执行阶段,除必要的模型 API 连接外,我们阻止其访问互联网。我们致力于维护 DeepSWE 的互联网隔离,审查智能体内置的工具,并阻止可能提供互联网访问的服务器端搜索和浏览功能。
Terminal-Bench 4.0
涵盖软件工程、机器学习、科学计算、安全和系统管理的终端任务。4.0 版本更新了任务说明、运行环境和验证器,调整了计算资源与时间预算,并移除了性能已饱和或存在问题的任务。
SWE-Atlas-QnA
围绕代码仓库提出问题,要求智能体追踪代码并解释其行为。我们遵循 Scale AI 公开的评分方法,使用 Claude Opus 4.5 作为评审模型。

评测任务

当前公开指数涵盖 3 个基准测试组件中的 303 个评测任务。

指数汇总的内容

对于每个智能体变体,Artificial Analysis 为每个包含的基准测试组件计算 pass@1 得分,然后将这些组件得分汇总为公开指数。

同一基准测试套件还支撑着基准测试页面上的公开汇总效率指标,包括运行成本、token 用量和执行时间。因此,性能视图和效率视图反映的是同一组基准测试覆盖范围,而非来自无关的运行。

评分与结果

pass@1 结果

SWE-Atlas-QnA 使用 Scale AI 的 Task Resolve Rate(任务解决率):智能体答案满足所有评分标准的任务所占的百分比。修改仓库中已跟踪文件的任务判为失败。

单项评测得分

我们先计算每项任务三次尝试得分的平均值,再对所有任务取平均,使每项任务的权重相同。

超过任务时间限制或因安全拒绝而受阻的尝试计零分。

奖励作弊(Reward Hacking)

奖励作弊指智能体在没有展示任务所衡量能力的情况下获得奖励,例如修改用于评分的测试,或直接获取已公开的解答而不是自行解出。Terminal-Bench 依据其排行榜完整性更新将这类尝试计为零分,Artificial Analysis 采用同样的规则。

检测目前仅适用于 Terminal-Bench 4.0:其任务、测试和参考解答均已公开,且尝试在可访问互联网的环境中运行。

如果智能体出现以下行为,该尝试会被判定为奖励作弊:

  • 修改测试文件、直接写入验证器的奖励文件,或以其他方式操纵评分机制或测试框架
  • 访问或复制任务附带的参考解答
  • 从外部来源获取任务的参考解答或预期输出,无论是通过网络搜索或抓取工具、curl 或 wget、克隆仓库,还是下载数据集或模型
  • 复现一个从未实际计算过的评分值

正常的网络使用可以通过:安装软件包和查阅文档是完成任务的正常部分。搜索无果同样如此:一个搜索解答但没有找到、随后自行解出答案的智能体,不算奖励作弊。

每个通过 Terminal-Bench 确定性验证器的尝试,都会由一个智能体评审(agent judge)通过 Harbor 的 harbor analyze 命令复核。智能体评审会阅读智能体的完整轨迹(它运行的每条命令和收到的每个响应),以及任务本身、其测试和参考解答。被判定为作弊的尝试计为零分。

智能体评审运行 Claude Code 与 Claude Sonnet 5,与 Terminal-Bench 用于其自身排行榜检查的智能体和模型相同。其提示词使用 Harbor 内置的 reward_hacking 标准,我们对其进行了扩展以涵盖从环境外部获取的答案。完整提示词如下。

效率指标

我们将成本、token 用量和执行时间报告为当前公开编程智能体基准测试套件中每任务尝试的汇总平均值。

  • 运行成本:基于服务商 token 定价而非消费者套餐的每任务平均按 token 付费 API 成本。
  • Token 用量:每任务平均输入 token、缓存 token、缓存写入 token、推理 token 和输出 token。
  • 执行时间:每任务平均实际运行时间,包括完整任务耗时以及可用时的智能体耗时子集。

如果某项指标缺少遥测数据,我们会将这些缺失值从相应平均值中排除,而非视为零。

在成本指标中,当服务商定价支持区分时,我们将缓存输入与非缓存输入分开计算;当服务商对创建提示词缓存状态收费时,我们也会纳入缓存写入费用。此举旨在比按固定单价估算更准确地反映按 token 付费的 API 定价。

智能体设置

公开基准测试行代表的是智能体变体,而不仅仅是模型名称。可能影响行为的设置在报告中分别列出。

推理设置由每个接受评估的具体配置决定。

随着新评测和智能体变体的加入,基准测试方法论可能会演变,但公开比较旨在反映已发布基准测试套件中同类智能体变体之间的对等对比。

版本历史

版本 1.5

2026 年 9 月至今

  • 将 Terminal-Bench v2.1 替换为 Terminal-Bench 4.0:包含 66 项更难的终端任务,更新了运行环境和验证器,并调整了计算资源与时间预算
  • 将 DeepSWE 从 v1.0 升级至 v1.1,保留相同的 113 项任务,更新执行环境,并对通过 commit 提交的补丁进行隔离验证
  • 将 SWE-Atlas-QnA 评分与 Scale AI 公开的方法保持一致,在 124 项代码仓库问答任务中使用 Claude Opus 4.5 作为评审模型

版本 1.4

2026 年 8 月至 9 月

  • 将 Terminal-Bench v2 升级至 Terminal-Bench v2.1,覆盖完整的 89 个任务
  • 新增与 Terminal-Bench 完整性方法论对齐的奖励作弊检测,被判定为奖励作弊的试验计 0 分
  • 修订了将推理 token 计入输出 token 的智能体的 token 计数方法

版本 1.3

2026 年 7 月至 2026 年 8 月

  • 优化了 SWE-Atlas-QnA 的二元 pass/fail 评分,使其与 Scale AI 的 Task Resolve Rate 方法论对齐

版本 1.2

2026 年 7 月

  • 将 SWE-Atlas-QnA 的评分方式从评分标准奖励改为二元 pass/fail,要求所有评分标准项均通过才能将任务标记为正确

版本 1.1

2026 年 6 月至 2026 年 7 月

  • 新增 DeepSWE(长周期软件工程)
  • 从 Coding Agent Index 中移除 SWE-Bench-Pro-Hard-AA

版本 1.0

2026 年 5 月至 2026 年 6 月

  • 初始版本,包含 SWE-Bench-Pro-Hard-AA(代码生成)、Terminal-Bench v2(智能体终端操作)和 SWE-Atlas-QnA(仓库问答)