Artificial Analysis 编程智能体基准测试
我们测量编程智能体在软件工程任务中的真实性能,包括成本、token 用量和执行时间。我们比较性能在不同智能体、模型和执行设置下的变化。
如需比较语言模型,请参阅我们的模型基准测试。
Artificial Analysis Coding Agent Index
由 3 个基准测试组成的综合指数:
- DeepSWESoftware engineering tasks, 113 tasks
- Terminal-Bench v2.1Agentic terminal use, 89 tasks
- SWE-Atlas-QnATechnical Q&A, 124 tasks
每个基准测试的分数是每个任务三次尝试的 pass@1 的平均值。指数对其 3 个基准测试组成部分赋予相同权重。有关评分细节和版本历史,请参阅方法论。
亮点
性能
Artificial Analysis Coding Agent Index上的性能。
Artificial Analysis Coding Agent Index
Harness 对比
Claude Opus 4.7 按 harness 划分的 Artificial Analysis Coding Agent Index。
Harness 对比:Artificial Analysis Coding Agent Index
Token 用量
Artificial Analysis Coding Agent Index上的 token 消耗,包括总用量、token 构成、效率以及各基准测试的细分。
每个任务的 Token 用量
Artificial Analysis Coding Agent Index vs. 总 Token
成本
基于当前按 token 计费的 API 价格的 Artificial Analysis Coding Agent Index成本,在可用时包括缓存写入价格和缓存折扣。许多用户通过订阅套餐而非按 token 付费来使用编程智能体的 harness。
每个任务的成本
Artificial Analysis Coding Agent Index vs. 每个任务的成本
执行时间
Artificial Analysis Coding Agent Index上的智能体活跃运行时间。
每个任务的时间
Artificial Analysis Coding Agent Index vs. 执行时间
常见问题
Artificial Analysis Coding Agent Index是我们对本页面公开基准测试套件中编程智能体性能的综合评分。它结合了 DeepSWE、Terminal-Bench v2.1和SWE-Atlas-QnA,将实现、终端工作流、代码库理解以及更广泛的软件工程性能汇聚为一个主要指标。
当前的公开指数包括 DeepSWE、Terminal-Bench v2.1和SWE-Atlas-QnA。这些基准测试之所以结合在一起,是因为它们考验编程智能体工作流的不同部分,而不是重复相同的任务格式。
公开基准测试套件混合了多种软件工程任务风格。有些是问答和代码库理解任务,侧重于阅读代码库、理解架构或行为并给出正确的技术答案。有些是实现和缺陷修复任务,需要修改代码,更接近经典的“做一个能用的补丁”的方式。有些是终端工作流任务,测试智能体能否在以 shell 驱动的环境中导航、正确执行工具并完成多步骤的命令行工作流。当前的三个基准测试都使用二元的任务结果。
问答式任务强调代码库理解、代码阅读、行为追踪以及给出正确的技术解释。实现式任务更接近交付一个可用的更改:智能体必须理解任务、在代码库中导航、正确编辑文件,并在执行约束下满足评估器或基于测试的结果。这些是相关的能力,但并不相同。一个智能体可能擅长代码库推理,却在可靠的补丁执行上较弱,反之亦然,这也是应将综合指数与各基准测试图表一起解读的原因之一。
基准测试页面报告按任务归一化的平均 pass@1。对于每个基准测试,我们先对每个任务的三次评估尝试取平均,然后对这些任务级别的分数取平均,使每个任务权重相等。当前所有组成部分的结果都是二元的。一次尝试即使顺利完成,如果未能满足其验证器,仍可能得零分。SWE-Atlas-QnA 的二元通过/失败评分与 Scale AI 的 Task Resolve Rate 方法论保持一致。
指数由 DeepSWE、Terminal-Bench v2.1和SWE-Atlas-QnA 计算得出。对于当前的 Artificial Analysis Coding Agent Index,公开的方法论是对这些基准测试分数的简单平均。随着覆盖范围的改进,基准测试方法论可能会演变,因此可比性最好在已发布的基准测试套件及其当前组成部分集合内解读,而不要当作一个恒久不变的绝对分数。
本页面的执行时间指每个任务的平均实际运行时间,而不仅仅是模型的原始延迟。它旨在反映运行整个智能体工作流时用户所感受到的时间成本。这包括用于推理、发出工具调用、读写文件、执行 shell 步骤以及等待模型响应的时间。因此,即使智能体的底层模型很快,如果其工作流更长或更依赖工具,整体上仍可能更慢。
Token 用量是基准测试套件中每个任务的平均观测 token 消耗。在本页面上,我们将其分为输入、缓存和输出 token。输入 token 是发送给模型的 token,包括提示、指令、工具上下文和任务上下文。缓存 token 是当提供商公开该遥测数据时,通过提示缓存复用的提示 token。输出 token 是模型在其响应中生成的 token。Token 用量之所以重要,是因为它常常决定成本,也能反映智能体完成工作所消耗的上下文量;但 token 效率与成本并不相同,因为提供商对各类 token 的定价不同,缓存也可能大幅改变账单。
更高的指数分数意味着在所包含的基准测试组合中整体性能更强,但并不意味着该智能体适用于每一种工作流。指数是基准测试质量之间的平衡,而不是对你在延迟、成本、工具或任务类型方面具体优先级的直接衡量。现实中的选择仍取决于你的工作流更接近代码库问答、打补丁还是终端执行,以及诸如 IDE 集成、模型可用性和可靠性等实际约束。
这些基准测试衡量编程智能体在代码库、工具、多步骤工作流和基于评估器的结果中的性能。本页面的结果反映的是经过评估的特定智能体变体,而不仅仅是通用的产品名称:模型选择、设置和执行配置都可能显著改变结果,这也是同一智能体系列可能在结果中以多个变体出现的原因。有关基准测试运行、任务级评分和方法论的更多背景,请参阅编程智能体基准测试方法论页面。 查看编程智能体基准测试方法论