Endpoint Accuracy Index v1.0 方法论
Endpoint Accuracy Index v1.0
Endpoint Accuracy Index 衡量同一模型在不同 API 服务商提供的接入点上,其智能与能力如何变化。不同服务商提供的同一模型可能因量化、默认采样设置、上下文处理、token 限制、提示词解析器及其他接入点配置而表现不同。为捕捉这些差异,我们针对每个服务商接入点重新运行固定评测套件,并报告该接入点复现模型准确率的程度。
我们还使用自行托管的模型部署作为基准,将每个服务商接入点的总体准确率表示为基准部署的百分比。该指数中,100% 表示接入点与参考部署一致,较低分数表示准确率低于基准。
我们会展示每项结果的统计显著性。每个接入点结果均包含根据各次重复间差异计算的 95% 置信区间,并标记该接入点在统计上是否处于参考范围内,或显著低于参考值。对于表现出影响结果的某些特征或不足的接入点,我们也会附上说明。
结果是特定时间点的快照,而非实时监控。每项结果均标注日期和所用重复次数,以便结合上下文解读。
评测套件
每个接入点均使用固定的三项评测套件进行测试,覆盖原生工具使用、高难度推理和长上下文回忆。各项评测的重复次数旨在使置信区间保持较窄,并会与结果一同展示。
Endpoint Accuracy Index v1.0 评测套件。较旧版本、完整版本和实验性变体不属于该套件。
| 评测 | 领域 | 子集 | 重复次数 | 权重 | 评分方式 |
|---|---|---|---|---|---|
| BFCL v4-500 | 工具 / 函数调用 | Berkeley Function Calling Leaderboard 的 500 任务子集 | 3 | 33% | 原生工具调用执行与匹配,取多次重复的平均准确率 |
| HLE-250 | 高难度推理 | Humanity's Last Exam 的 250 题子集 | 10 | 33% | 等价性检查 LLM,取多次重复的平均准确率 |
| AA-LCR-25 | 长上下文回忆 | Artificial Analysis Long Context Reasoning 的 25 题子集 | 10 | 33% | 等价性检查 LLM,取多次重复的平均准确率 |
评测数据集
BFCL v4-500: 工具 / 函数调用
- 衡量内容:BFCL(Berkeley Function Calling Leaderboard)评测模型使用原生工具 / 函数调用的可靠性,涵盖简单、并行、多函数和多轮调用,以及无关性检测(判断何时不应调用工具)。我们运行一个仅离线的 500 任务子集,并提高多轮和并行等最具挑战性类别的占比。BFCL v4-500 子集排除了已趋于饱和、资源消耗较大或区分度较低的类别(Java/JS、内存、网络搜索和实时相关性)。 我们使用 2026.3.23 版本。
- 子集与重复次数:Berkeley Function Calling Leaderboard 的 500 任务子集,运行 3 次。
- 评分方式:原生工具调用执行与匹配,取多次重复的平均准确率。
- 参考资料:https://gorilla.cs.berkeley.edu/leaderboard.html
- 部分接入点可能失败的原因:工具限制、工具 schema 解析与返回格式、上下文限制。
HLE-250: 高难度推理
- 衡量内容:Humanity's Last Exam(HLE)是一项前沿学术基准测试,包含由专家编写的数学、自然科学和人文学科高难度问题。我们运行一个纯文本的 250 题子集,并提高完整数据集中更难、更具挑战性问题的占比。 完整版本作为 Artificial Analysis Intelligence Index 的一部分运行。
- 子集与重复次数:Humanity's Last Exam 的 250 题子集,运行 10 次。
- 评分方式:等价性检查 LLM,取多次重复的平均准确率。
- 参考资料:https://huggingface.co/datasets/cais/hle
- 部分接入点可能失败的原因:上下文与输出 token 限制/截断、推理强度限制、量化与推理精度。
AA-LCR-25: 长上下文回忆
- 衡量内容:AA-LCR(Artificial Analysis Long Context Reasoning)测试模型在多篇长文档上进行推理的能力(每题约 10 万个输入 token)。我们运行一个 25 题子集,并提高完整数据集中更难、更具挑战性问题的占比。 完整版本作为 Artificial Analysis Intelligence Index 的一部分运行。
- 子集与重复次数:Artificial Analysis Long Context Reasoning 的 25 题子集,运行 10 次。
- 评分方式:等价性检查 LLM,取多次重复的平均准确率。
- 部分接入点可能失败的原因:上下文窗口限制、输入截断、空响应。
评分
每项评测都会得出多次重复的平均准确率。综合 Endpoint Accuracy Index 是三项评测分数的加权结果,并归一化到 0 至 100:
每项评测的平均准确率(0 至 1)乘以其权重,再除以总权重。三项评测权重相同(33% / 33% / 33%)。仅当接入点的三项评测均有当前版本结果时,才会计算综合分数。
若存在自行托管的参考接入点,则每项评测和综合层面的分数均以参考值的百分比表示,并对各评测比值采用相同的加权方式:
每个接入点的分数以参考值的百分比展示,并包含一个结合自身与参考值不确定性的 95% 置信区间。我们根据各次重复间差异,使用双侧 95% Student-t 检验构建该区间,以平方和开根的方式合并三项评测,再与参考值(100%)比较:
- 处于范围内:置信区间包含参考值——与参考值在统计上无法区分。
- 显著超出范围:置信区间完全位于参考值之外——差异具有统计显著性。
图表会展示每个接入点的精确分数和置信区间。
数据层保留 0 至 1 的原始分数,仅在展示时乘以 100。对于每个接入点,我们采用各项评测的最新运行结果;若存在多次运行,优先选择日期最近的结果,同一天内则选择出错任务最少的运行。
推理参数
接入点使用标准化设置进行评测,确保差异来自接入点,而非测试框架:
- 采样:所有接入点统一使用标准化的默认采样设置:若模型实验室指定了建议温度,则采用该温度;否则推理模型使用 0.6,与 Artificial Analysis Intelligence Index 的做法一致。
- 推理:使用接入点支持的最高推理模式。
- 工具调用:使用 API 默认设置,将工具选择设为 auto,并启用严格 schema 遵循。如果接入点不支持其中某项设置,则回退到该接入点最接近的受支持设置。
- 流式传输:基准设置为启用流式传输。不支持流式传输的接入点则在禁用流式传输的情况下运行。
- 输出与上下文:使用接入点支持的最大输出 token 数和上下文窗口。
参考运行与可复现性
每个模型的参考运行均为自行托管的模型部署,通常使用 vLLM 或 SGLang。我们按照模型实验室和服务框架建议的设置配置服务器(例如使用 vLLM 配方或 SGLang 指南),并采用模型推理建议的最高精度设置。关键配置详情(例如服务框架与 CUDA 版本、模型权重信息和启动参数)都会记录并与结果一同展示,可在参考运行结果的备注项及下方查看。
评测套件固定为特定版本,确保结果在不同时间和接入点之间可比。
DeepSeek V4 Pro
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.12 (Docker image: lmsysorg/sglang:deepseek-v4-blackwell)
- CUDA: 13.0
- Precision: native — W4A8 MoE experts (MegaMoE) + FP8 (e4m3) attention/dense
- Model weights: deepseek-ai/DeepSeek-V4-Pro on Hugging Face
Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: deepseek-v4
- tool-call-parser: deepseekv4GLM-5.2
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13 (Docker image: lmsysorg/sglang:latest)
- CUDA: 13.0
- Precision: native FP8 with DeepGEMM kernels
- Model weights: zai-org/GLM-5.2-FP8 on Hugging Face
Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: glm45
- tool-call-parser: glm47gpt-oss-120b
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13.post1 (Docker image: lmsysorg/sglang:v0.5.13.post1)
- CUDA: 13.0
- Precision: native MXFP4 (FlashInfer MXFP4 MoE kernels) + BF16 attention/dense
- Model weights: openai/gpt-oss-120b on Hugging Face
Key SGLang launch args:
- kv-cache-dtype: bfloat16
- reasoning-parser: gpt-oss
- tool-call-parser: gpt-oss特定时间点的结果
接入点准确率结果是注明日期的快照,而非实时监控。服务商可能更新服务栈和接入点配置,因此接入点会随时间变化;每项结果均标注测量日期。我们按既定周期以及应服务商请求重新运行评测,并始终展示最新结果及其日期。
模型选择
我们优先对拥有广泛服务商生态、由多家服务商提供同一模型的模型进行接入点准确率基准测试(最常见的是由多家推理服务商提供的开放权重模型),同时也优先考虑在生产环境中广泛使用的模型。纳入范围会随着新模型和服务商的加入而轮换,并非固定不变。
目前拥有 Endpoint Accuracy Index 数据的模型包括: