AA-AgentPerf 方法论
概述
AA-AgentPerf 是一项硬件基准测试,衡量一个推理部署在真实智能体工作负载下能够支持多少个活跃智能体,同时满足每个智能体的速度目标。
- 真实智能体轨迹 — 多轮编程会话,包含交替出现的推理、工具调用和可变上下文长度(非合成的均匀提示词)。
- 持续并发负载 — 模拟智能体持续保持进行中的请求,对 KV cache 复用、推测解码和调度器行为施加压力。
- 基于市场的 SLO 层级 — 基于 Artificial Analysis Serverless API 基准测试数据的性能阈值,反映各服务商实际观察到的服务质量水平。
- 持续更新 — 随着新硬件、软件栈和模型版本的推出,结果将持续更新。
- 生产就绪 — 模型在启用贴近生产环境的优化和生产规模部署拓扑的条件下进行测试。
每个模拟智能体按顺序执行智能体编程轨迹——推理、调用工具和编辑代码——同时系统进行扩展以支持不断增长的并发量。
数据集
AA-AgentPerf 数据集包含涵盖多种用例、编程语言和模型的真实智能体轨迹。轨迹在 OpenCode 智能体测试框架中生成,使用三个顶尖开源模型并启用推理——DeepSeek V3.2、GLM 4.7 和 Kimi K2.5——提示其解决真实公开代码仓库中的问题。所有轨迹均包含交替出现的推理和工具调用。
- Input Sequence Length (ISL):范围从约 5K 到约 131K token,均值约为 27K token。轨迹会被截断以适应被测模型的最大推荐上下文长度。
- Output Sequence Length (OSL):各轮次的输出长度差异很大——有些轮次产生较短的输出(如简单的工具调用),而有些轮次则涉及模型在响应或执行操作之前的大量推理。
- 编程语言:涵盖 12 种以上编程语言,基于源仓库的主要语言。Python 仓库是最常见的来源,其次是 TypeScript 和 Go。
- 工具调用延迟:每次工具调用后,使用固定的每消息延迟来模拟处理时间,该延迟从真实工具调用时长的分布中采样,并按所调用的工具进行分区。延迟范围从不到 0.1 秒到 5 秒,中位数约为 1 秒。
向测试参与者提供一个具有代表性的调优子集——包含 500 条唯一轨迹、共 18,997 条提示词——用于配置验证和性能调优。完整测试数据集保持私有,以防止针对基准测试的定向优化。
服务等级目标
性能 SLO 基于 Artificial Analysis Serverless API 基准测试数据确定。针对每个被测模型,已识别出市场上当前可用的各层级服务水平。供应商分别针对每个层级进行优化,以最大化其在该服务水平下能够支持的并发智能体数量。
速度和延迟均在每请求级别计算。由于智能体工作负载中包含大量小 OSL 请求,因此采用 P25 输出速度,百分位数基于某一阶段内发送的所有请求计算。
每个模型使用其开发商推荐的采样参数并在最大可用推理强度下进行测试:DeepSeek V4 Pro 和 Kimi K3 使用 max 推理强度,gpt-oss-120b 使用 high 推理强度,其他参数均设为默认值。
我们正从分别使用输出速度和 TTFT 指标,过渡到使用综合的端到端速度指标。在过渡期间,部分统计数据将以速度/TTFT 表示,另一些将以端到端速度表示。
| 模型 | SLO 层级 | P25 输出速度 (tokens/s) | P95 TTFT (s) |
|---|---|---|---|
| DeepSeek V4 Pro (max) | SLO #1 | 20 | 10 |
| SLO #2 | 60 | 5 | |
| SLO #3 | 180 | 3 | |
| gpt-oss-120b (high) | SLO #1 | 100 | 5 |
| SLO #2 | 250 | 3 | |
| SLO #3 | 500 | 2 | |
| SLO #4 | 2,000 | 1 | |
| Kimi K3 (max) | 我们正在试用一种以完整帕累托前沿为重点、不使用 SLO 的 Kimi K3 新配置 | ||
性能 SLO
测试执行
每个 SLO 所支持的智能体数量通过初始指数递增后的二分搜索确定。指标使用稳态 token 计时信息计算。当一个阶段完成且指标计算结束后,系统判断是否违反了 SLO,然后进入下一个目标并发级别。每个阶段持续运行直至满足以下条件:至少 30 条轨迹已完成、每个模拟智能体已完成至少 3 条轨迹、且至少 10 分钟的稳态测量时间已过。智能体的轨迹分配在各阶段间是确定性的,每个阶段中每条轨迹开头会添加动态生成的前缀,以打破阶段间的前缀缓存。max_tokens 值设为 16K,防止模型陷入重复循环的个别请求对结果产生偏差。
| Phase | Agents | p25 Speed | Result |
|---|
随着并发智能体数量增加,每请求输出速度下降。每个 SLO 层级定义了最低可接受速度,从而确定该层级能够支持的最大智能体数量。
指标与结果
在每个测试阶段中计算以下计时指标:
- 首 Token 延迟 (TTFT):每请求延迟,从发送请求到收到第一个输出 token 的时间。
- 输出速度:每请求每秒输出 token 数,从收到第一个 token 后开始计算。
- 端到端速度:按完整请求计算的每请求每秒输出 token 数,包括等待首个 token 的时间。该单一指标正在取代上述两个指标。
- 系统输出吞吐量:所有并发智能体的总输出 token 每秒数。
所有指标均过滤至稳态时段,即所有智能体在目标并发量下已活跃至少 30 秒。速度指标使用推理框架返回的用量元数据中的服务端 token 计数,并通过候选模型的原生分词器进行本地分词验证。功耗在实际测试期间从每个加速器上测量。主要结果——每个 SLO 层级的最大并发智能体数和输出吞吐量——按加速器和按 MW 进行归一化,以实现硬件配置间的公平比较。每 MW 数据基于负载下测量的加速器功耗(GPU 芯片 + HBM),而非额定 TDP。
结果发布在 Artificial Analysis 排行榜上,附有供应商披露的完整系统配置。供应商可在发布前审核其结果的事实准确性。
提交
如果您是硬件供应商,有意提交您的系统参加 AA-AgentPerf 评测且尚未与我们取得联系,请发送邮件至 agentperf@artificialanalysis.ai。