文本转语音基准测试方法论

范围与背景

Artificial Analysis 对通过 Serverless API 接入点提供的文本转语音模型进行基准测试。本页介绍我们的文本转语音基准测试方法论,涵盖质量基准测试与性能基准测试。当客户仅按实际用量付费、而非为获取访问权限支付固定费用时,我们将该文本转语音接入点视为 Serverless(无服务器)接入点。

无论是在性能基准测试中,还是在语音竞技场(Speech Arena)内,我们关注的都是用户使用 Serverless API 时的终端用户体验。我们重点衡量在本地接收到音频文件所需的时间。当 API 返回的是 URL 而非字节数据时,我们会将下载该文件的时间计入响应时间的测量。我们的做法是按照各服务商文档的建议,使用其 API 的标准实现方式。在服务商 API 提供相应选项的情况下,我们会将音频采样率统一为 22.05 kHz。

关键指标

我们使用以下指标来跟踪文本转语音模型的质量、性能与价格。

质量 Elo

由用户在Artificial Analysis 文本转语音竞技场中的投票所确定的模型相对 Elo 分数。

部分模型可能因尚未获得足够票数而未被展示。我们使用的线性回归模型,与LMSYS 计算 Elo 分数的方式类似,Chatbot Arena 采用的正是该方法。

每 100 万字符价格

所有 TTS 模型的价格均以每 100 万输入文本字符的价格来报告。当服务商并非直接按字符计费时,我们会推算出一个等价价格:

  • 按字符计费:直接采用公布的费率
  • 订阅套餐:采用至少包含 100 万字符、成本最低的套餐(有年付方案时采用年付)的实际有效费率,并假设用量利用率为 80%
  • 基于 token 计费:使用批量定价推算,将字符换算为输入 token,并估算输出音频的时长
  • 按输出时长计费:按假定语速每分钟 150 词(约合每分钟 825 个字符)进行换算
  • 按字节计费:对于英文文本,1 个 UTF-8 字节约等于 1 个字符
  • 按推理时间计费:根据使用约 25 段约 500 字符文本的基准测试运行结果进行估算
  • 开放权重:没有商业 API 定价;列出时不含价格
  • 语音到语音模型:根据为 20 条固定的 TTS 竞技场提示词生成语音的成本推算,依据的是所报告的文本输入、输出音频、输出文本,以及单独披露的推理/思考 token。当输出文本 token 被作为音频响应的一部分进行报告时,会将其计入。我们不考虑缓存带来的影响,因为这些提示词是作为单轮请求独立运行的,其对价格的影响可以忽略不计。

在报告价格时,我们不计入临时性折扣。

生成时间

服务商生成一段输入约 500 字符的音频片段所需时间的中位数,基于过去 14 天的测量数据计算。

当服务商返回的是 URL 而非音频响应时,生成时间包含从服务商处下载该音频片段的时间。这样做是为了反映终端用户拿到已生成音频片段的延迟,同时也因为 URL 可能在音频生成完成之前就已生成。在相关情况下,音频片段以批大小为 1 的方式生成。

基准测试每天在随机时间进行 4 次。在每一次基准测试评估中,我们为每个模型随机选择一个音色。每次生成都使用一条约 500 字符的独特提示词。

受控音色

受控音色竞技场使用声音克隆技术,来统一评测各个文本转语音模型时所使用的音色。通过使用相同的参考音色来比较模型,可以将听众对某一特定音色的偏好,与模型质量的更广泛方面区分开来,例如语音自然度、音频质量、发音、节奏与韵律。这使得对底层文本转语音模型的比较更为对等。

受控音色竞技场是对我们服务商音色竞技场的补充——在后者中,每个模型使用其自身公开可用音色中一组具有代表性的音色进行评测。参考音色集包含 8 个由专业录制的音色:2 个美国女声、2 个美国男声、2 个英国女声和 2 个英国男声。请在下方选择一个受控音色,收听其参考录音。

服务商音色

服务商音色竞技场使用该模型服务商所提供音色中一组具有代表性的音色,来评测每个文本转语音模型。这是对受控音色竞技场的补充——在后者中,模型使用相同的克隆参考音色进行比较。服务商音色反映了用户通过模型自身的公开 API、产品界面或文档实际体验到该模型的典型方式。

对于每个模型,我们会选择多个由服务商提供的音色,以使比较具有代表性且公平。我们为男声与女声、美国口音与英国口音的每一种组合各选择 2 个音色,共计 8 个音色。若某一性别与口音的组合不可用,我们会在服务商音色竞技场的评测中排除该组合。

音色的选择依据其在服务商界面和文档中的突出程度,并排除本身不够中性的音色(例如风格化程度很高的地方口音)。在可选音色较多的情况下,模型开发商也可以要求我们使用特定音色。若未提供服务商音色(开放权重模型通常如此),我们会使用专业配音演员的语音片段作为生成语音的源文件(示例见上文“受控音色”)。

请在下方选择一个模型开发商,查看其各个模型当前所使用的服务商音色。

模型与服务商收录标准

我们的目标是分析和比较热门且表现优异的文本转语音模型与服务商,以帮助终端用户选择使用哪一个。为此,我们采用“行业重要性”和竞争力表现测试来评估是否收录新的模型与服务商。我们正在完善这些标准,欢迎任何反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。

基准测试每天在随机时间进行 4 次。在每一次基准测试评估中,我们为每个模型随机选择一个音色。每次生成都使用一条约 500 字符的独特提示词。

独立性声明

基准测试在严格独立与客观的前提下进行。我们不会因在 Artificial Analysis 上被收录或获得有利结果而从任何服务商处收取报酬。