Mobile Device Benchmark Set 方法论

概述

Mobile Device Benchmark Set 指我们当前用于衡量小到足以在手机上运行的语言模型智能的五项评测集合。它采用与 Artificial Analysis 各处相同的独立评测方法。

我们评测的不是原始的全精度权重,而是手机在实际使用中运行的量化版本。因此这里的分数可能与同一模型在 Artificial Analysis 其他页面上的分数有所不同。

准入标准

如果一个模型在量化后(包含 8K 上下文的 KV 缓存)能装入 8 GB 内存,我们就将其定义为理论上小到足以在手机上运行。计入 KV 缓存是因为模型除了权重之外还需要为上下文预留内存,而 8K 是对包含指令和工具定义的日常端侧任务所需 token 数量的一个偏于宽松的上限估计。

在结果页面上,符合条件但未能在所选设备(以所选量化)上正常运行的模型会以不同的颜色或图案显示,以表明该模型、量化、推理框架与设备的组合可能不可行。

评测运行方式

  • 当前版本使用 4-bit(Q4_K_M)或更低精度的 GGUF 量化版本,通过 llama.cpp 提供推理。
  • 所有评测均在 16K token 的上下文窗口下运行。回复长度受该窗口与模型自身输出 token 上限中较小者的限制;我们不压缩或裁剪上下文,因此模型若在给出最终答案前耗尽 token,该次尝试记为错误。 相比手机在实际使用中通常低于 4K 的现实上下文上限,这一上下文限制是宽松的。基准结果中还包含 1 分钟时间限制下的结果,以便从更严格的角度观察模型表现;64K 上下文限制下的结果即将发布。
  • 每项评测对每道题运行 5 次重复并按 pass@1 计分;AA-Omniscience 除外,它对其 6,000 道题只运行单次。
  • 同时支持推理模式和非推理模式的模型将在两种设置下分别评测,并作为独立变体列出。初期每个模型各模式的覆盖可能并不完整。

组成评测

基准集的第一个版本由五项评测组成,每项均由 Artificial Analysis 独立测量:

  • BFCL。在为小模型挑选的 640 道任务子集上测试工具调用,三个任务类别权重相同。
  • IFBench。带有精确、可验证输出约束的指令遵循。
  • AA-Omniscience。事实知识与抗幻觉能力,均分为准确率和非幻觉两部分。
  • GPQA Diamond。研究生水平的科学推理。
  • MATH-500。数学问题求解。

选择这些评测是为了体现小模型需要应对的指令遵循、工具调用、知识回忆与推理的组合。它们以简单平均(等权重)合并,得出最终的智能分数。

随着我们不断改进小模型和移动设备的基准测试实践,预计这些评测在未来会有所调整。

BFCL

Berkeley Function Calling Leaderboard(BFCL)v4 衡量模型调用工具的能力。我们运行一个对小模型有意义的 640 道任务子集,取自三个类别,各占 BFCL 得分的三分之一:

  • Multiple(200 道):从多个可用函数中选出正确的一个,并以正确参数调用。通过将调用与预期结构匹配来计分。
  • Multi-turn base(200 道):跨多轮工具使用完成任务。按调用序列及其产生的最终状态计分。
  • Irrelevance(240 道):识别出没有任何可用工具适合该请求,选择拒绝而非强行调用。

我们与官方 BFCL 设置的差异:

  • 所有任务均来自 BFCL 作者编写的 non-live 划分。众包的 live 划分是基准集未来版本的候选。
  • 我们只测试原生函数调用(BFCL 的 FC 模式),因为应用程序通常就是这样向模型传递工具的。我们不使用 BFCL 的 prompting 模式——该模式在提示词中传递工具,而非通过 API 的工具接口,并从模型的回复中解析调用。
  • 我们使用每个模型的原生工具调用,由 llama.cpp 依据模型的聊天模板完成解析,并且不会尝试从文本内容中挽救工具调用:运行时无法执行的工具调用记为失败,正如在真实应用中一样。
  • 请求通过我们标准的供应商栈发送,而非 BFCL 针对各模型的处理器。

数据集:BFCL v4 的 non-live 划分,由加州大学伯克利分校开发,维护在 Gorilla 仓库中。

IFBench

IFBench 测试模型能否遵循精确、可验证的指令,例如字数、格式规则和句子改写。将其纳入是因为可靠地遵循指令是人们向小模型提出的几乎所有需求的基础。

  • 数据集:单轮 IFBench 集,共 294 条提示词(allenai/IFBench_test)。我们不使用多轮版本。
  • 回复只有满足提示词中的每一条指令才算通过(提示词级准确率)。
  • 回复使用 allenai/IFBench 的官方代码以 loose 模式检查,该模式容忍答案前后多余的文本和格式。

AA-Omniscience

AA-Omniscience 是我们自研的知识与幻觉基准:6,000 道题,覆盖商业、法律、健康、软件工程、科学与人文等 42 个主题。它奖励精确的知识,惩罚自信的错误回答。

  • 公开子集:ArtificialAnalysis/AA-Omniscience-Public
  • 每条回复由 LLM 评分器评为正确、错误、部分正确或未作答。
  • 它为平均分贡献两个权重相同的部分。准确率是正确回答的问题所占比例。非幻觉等于 1 减去幻觉率,其中幻觉率是在未正确回答的问题中模型回答错误的比例。
  • 纳入非幻觉是有意为之:我们不期望小模型对冷门概念有广泛的知识,但它们需要在不知道正确答案时不作答或不采取行动,以此体现可信度。
  • 完整细节(包括评分方法)见我们智能指数方法论中的 AA-Omniscience 一节

GPQA Diamond

GPQA Diamond 以生物、物理和化学的选择题测试研究生水平的科学推理。

  • 数据集:GPQA 的 Diamond 子集,共 198 道题、每题 4 个选项,是基准作者从完整数据集中挑选出的最高质量部分。
  • 答案用正则表达式提取并按 pass@1 计分,使用与我们主智能指数相同的选择题提示词(见提示词模板)。

MATH-500

MATH-500 是一套 500 道高中竞赛数学题,覆盖多个科目和难度层级。

  • 数据集:HuggingFaceH4/MATH-500
  • 要求模型逐步解题,并把最终答案写在方框中。
  • 评分先对提取的答案做符号化校验,使同一答案的等价形式也能匹配;无法判定时,由 LLM 相等性检查器决定答案是否与参考一致。

手机上的推理

手机上的推理性能(包括速度、延迟和内存占用)通过我们与 Liquid AI 的合作单独进行基准测试,测量直接在设备上完成。Liquid AI 的测量平台(及结果查看器)名为 Pipette。