Artificial Analysis 基准测试方法论
范围
Artificial Analysis 对 AI 模型、推理 API 接入点和系统进行智能、质量、性能与价格方面的基准测试。本网站的这一部分介绍我们的基准测试方法,涵盖质量基准测试与性能基准测试。
在语言模型基准测试中,我们将客户仅按实际用量付费、而非为访问某个系统支付固定费用的接入点视为 Serverless(无服务器)接入点。通常这意味着接入点按 token 计费,且输入 token 与输出 token 往往价格不同。
在所有模态上,我们的性能基准测试衡量的都是 AI 推理服务与系统的客户实际体验到的端到端性能。因此,基准测试结果并不代表某一特定硬件平台上可能达到的最高性能,而是代表客户在各服务商处实际体验到的真实性能。
我们对专有模型和开放权重模型都会进行基准测试。
方法详情
定义
在本页面以及整个 Artificial Analysis 网站中,我们使用以下术语:
- 模型: 大语言模型(LLM),包括专有模型、开源模型和开放权重模型。
- 模型开发商: 开发并训练该模型的机构。例如,OpenAI 是 GPT-4 的开发商,Meta 是 Llama 3 的开发商。
- 接入点(Endpoint): 模型的一个托管实例,可通过 API 访问。同一个模型在不同服务商处可能有多个接入点。
- 系统: 用于运行 AI 模型的专用计算环境,通常是已预置的基础设施(例如虚拟机),可以对其在负载下的性能进行基准测试。
- 服务商: 托管并提供一个或多个模型接入点或系统访问的公司,例如 OpenAI、AWS Bedrock、Together.ai 等。同一家公司往往既是模型开发商,也是服务商。
- Serverless(无服务器): 按实际用量提供的云服务;就 LLM 推理 API 而言,通常指按输入和输出 token 计费。Serverless 云产品当然仍然运行在服务器上!
- 开放权重: 由模型开发商公开发布了权重的模型。我们使用“开放权重”或简称“开放”模型,而不是“开源”,因为许多开放的 LLM 所采用的许可证并不完全符合开源软件的定义。
- Token: 现代 LLM 以 token(词元)为基础构建——token 是词语和字符的数字化表示。LLM 以 token 作为输入,并生成 token 作为输出。输入文本由分词器(tokenizer)转换为 token。不同的 LLM 使用不同的分词器。
- OpenAI Token: 由 OpenAI 的 GPT-3.5 与 GPT-4 分词器生成的 token;在 Artificial Analysis 的基准测试中,一般使用 OpenAI 的 Python 包 tiktoken(o200k_base 分词器)进行统计。我们将 OpenAI token 作为 Artificial Analysis 全站统一的计量单位,以便在模型之间进行公平比较。所有“每秒 token 数”指标均指 OpenAI token。
- 原生 Token: 由 LLM 自身分词器生成的 token。我们用“原生 token”与“OpenAI token”相区分。价格通常以原生 token 计算。
- 价格(输入/输出): 服务商对发送给模型的每个输入 token 和从模型接收的每个输出 token 所收取的价格。页面所示价格为服务商当前公布的价格。
- 混合价格: 为便于比较,我们按缓存命中 token、输入 token 与输出 token 7:2:1 的比例计算混合价格。
- 每任务成本: 完成一项 Artificial Analysis Intelligence Index 任务的加权平均成本(美元)。计算方式为:将输入 token、缓存 token 和输出 token 的价格分别乘以整个工作负载中消耗的相应 token 数量,按Intelligence Index 使用的各项基准测试权重加权,再除以任务数量。价格取服务商自有(第一方)API 的费率,或所有服务商价格的中位数。各服务商的缓存费用不同。由于成本反映的是实际的 token 消耗量,即使单位 token 价格相同,输出更长答案或更多推理 token 的模型,其每任务成本也会更高。
其中 i = Artificial Analysis Intelligence Index 中的每一项基准测试,w = 该基准测试在 Index 中的权重
- 首 Token 延迟: 从向服务或系统发送请求到接收到响应的第一个 token 所经过的时间(秒)。对于会返回推理 token 的推理模型,这里指第一个推理 token。
- 首个答案 Token 延迟: 从向服务或系统发送请求到接收到响应中第一个答案 token 所经过的时间(秒)。对于推理模型,该 token 出现在任何“思考”时间结束之后。
- 输出速度(每秒输出 token 数): 在收到第一个 token 之后,平均每秒接收到的 token 数量。
- 生成 100 个输出 Token 的总响应时间: 生成 100 个输出 token 所需的秒数,基于 TTFT 与输出速度合成计算,以确保最大的可比性。
- 端到端响应时间: 接收完整响应所需的总时间,包括输入处理时间、模型推理时间和答案生成时间。
- 平均推理 Token 数: 推理模型在给出答案之前输出“推理”token 所花费的时间。该指标基于一组 60 条多样化提示词上“推理”token 数量的平均值计算。若某个模型的平均推理 token 数无法获取或尚未计算,我们按 2k 个推理 token 估算。这些提示词长度各异,覆盖多个主题,包括个人相关问题、商业相关问题、编程、数学、科学等。提示词一部分由 Artificial Analysis 撰写,另一部分来自以下评测集:MMLU Pro、AIME 2025 和 LiveCodeBench。可在此处获取这些提示词。