系统负载测试(AA-SLT)方法论

概述

该基准测试通过在测试阶段保持向系统发送固定数量的并行查询来衡量系统性能。每当一个单独的查询完成后,会立即向该机器发送另一个查询。这样既能确保系统在稳定负载下接受基准测试,又能尽量减小测试方差。

我们会测量每个阶段从系统接收到的 token 总量,该数值构成我们的系统输出吞吐量指标。我们同时也会测量每次查询的性能,这些数据构成我们的各项每查询指标(通常以中位数或平均数表示)。

该基准测试采用分阶段的方式进行。每个基准测试阶段持续 3 分钟,并发查询的数量在随后的每个阶段逐步提升。基准测试会持续进行,直到达到系统的输出吞吐量上限,即在更高并发下相比此前各阶段不再接收到额外的 token。

关键技术规格

  • 阶段时长: 每个阶段持续 3 分钟(不包括加压和冷却阶段)。
  • 并发级别: 1、2、4、8、16、32、64,此后以 64 为增量递增,直到系统输出吞吐量上限趋于平稳。
  • 工作负载形态: 每次查询 1,000 个输入 token 和 1,000 个输出 token。
  • 流式输出(streaming): 基准测试在启用流式输出的情况下进行。
系统负载测试示意图

Artificial Analysis 系统负载测试(4 个并发请求的示例)

关键测量指标

  • 系统输出吞吐量: 在整个基准测试阶段内,所有并发请求合计的平均每秒输出 token 数。
  • 响应率: 在基准测试阶段发送的查询中,收到响应(至少 1 个输出 token)的查询所占比例。
  • 每次查询的端到端延迟: 每次查询自发出时起的端到端响应时间。各项数值以每个并发阶段的中位数报告。
  • 每次查询的输出速度: 每次查询在收到第一个 token 之后的每秒输出 token 数。各项数值以每个并发阶段的中位数报告。