文本转语音基准测试方法论

范围与背景

Artificial Analysis 主要对通过 Serverless API 接入点提供的文本转语音模型进行基准测试。本页介绍我们的文本转语音基准测试方法论,涵盖质量基准测试与性能基准测试。速度与价格指标需要 Serverless 接入点。不具备该接入点的模型仍可能仅为进行质量比较而纳入竞技场。

无论是在性能基准测试中,还是在竞技场内,我们关注的都是用户使用 Serverless API 时的终端用户体验。我们按照各服务商文档的建议使用其 API 的标准实现方式。

关键指标

我们使用以下指标来跟踪文本转语音模型的质量、性能与价格。

质量 Elo

由用户在Artificial Analysis 文本转语音竞技场中的投票所确定的模型相对 Elo 分数。排名由两两对比的投票通过极大似然估计拟合的 Bradley-Terry 模型计算得出。评分以每个竞技场中固定为 1000 分的一个模型作为锚点,其余分数按标准 Elo 刻度相对该锚点给出。关于对比的呈现方式与投票机制,请参阅下文的竞技场的运作方式。

对局抽样会优先选择需要更多对比的模型,例如新加入的模型以及尚无评分的模型,使新模型能够较快积累对比次数。同时,我们限制单一对手在某一模型全部对比中所能占据的比例;在估计阶段,对高频重复组合的对局降低权重,使任何单一组合都不会主导某个模型的评分。在我们的实验中,服务商音色竞技场与受控音色竞技场的排名对该权重的强度均不敏感。

每个榜单都独立拟合:总体评分使用全部符合条件的投票,而按类别、口音和语言划分的榜单则是在各自子集上分别拟合的结果,并非对总体结果的汇总。榜单历史中所有符合条件的投票权重相同,不做时间加权,也不对较早的投票做衰减。评分每天依据完整投票记录重新计算多次,并在发布前经过复核。我们会展示 95% 置信区间和排名区间,模型按未经四舍五入的 Elo 排序。部分模型可能因尚未获得足够票数而未被展示。

Pronunciation Robustness

Pronunciation Robustness 基准测试衡量 Text to Speech 模型能否正确读出高难度文本。它通过让每个模型朗读一组固定的挑战句子并由人工评审依据可接受读法进行判定,来补充 Arena 偏好结果。

所有模型使用同一个固定的美式英语语音朗读完全相同的句子集。每个句子包含一个或多个高亮片段,并附有可接受发音,包括美式和英式英语中均有效的变体。剪辑以随机顺序、不显示模型名称地提供给评审。提示词按原文发送给各模型,我们不做任何归一化处理。如果模型提供文本归一化设置,我们使用其默认值。

该句子集涵盖四类发音挑战:

  • Contextually Appropriate(Contextual Disambiguation): 拼写相同但因上下文而读法不同的单词,例如 a wound that is bandaged 与 a bandage that is wound。
  • Expanding Shorthand(Text Normalization): 自然读出数字、日期、单位和记号,例如 6'2"、Chapter XVII 或 1 tsp of sugar。
  • Preserving Exact Sequences(Sequence Fidelity): 精确读出代码、路径、邮箱和标识符,例如 .env.local 或 a.chen@ucsf.edu。
  • Standalone Terms(Term Pronunciation): 正确读出品牌、地名和专业术语,例如 Arkansas、façade 或 genre。

对于每个发布的模型,95% 以上的剪辑由三名或以上第三方评审判定。针对每个高亮片段,评审以是、否或无法判断作答,判断其发音是否自然且正确。模型得分是回答"是"的判定占"是"加"否"的比例。"无法判断"的回答不计入分母。各类别得分对该类别的片段使用相同公式。误差线表示 95% 置信区间,由于每个片段由多名评审判定,采用按片段聚类的标准误计算。

当句子集中至少 95% 的样本由三名或以上经审核的评审覆盖时,我们才发布该模型的结果。

请参阅 Pronunciation Robustness 概览,查看评审所见评分卡的示例以及基准测试中每个模型的示例剪辑。

每 100 万字符价格

所有 TTS 模型的价格均以每 100 万输入文本字符的价格来报告。当服务商并非直接按字符计费时,我们会推算出一个等价价格:

  • 按字符计费:直接采用公布的费率
  • 订阅套餐:采用至少包含 100 万字符、成本最低的套餐(有年付方案时采用年付)的实际有效费率,并假设用量利用率为 80%
  • 基于 token 计费:使用批量定价推算,将字符换算为输入 token,并估算输出音频的时长
  • 按输出时长计费:按假定语速每分钟 150 词(约合每分钟 825 个字符)进行换算
  • 按字节计费:对于英文文本,1 个 UTF-8 字节约等于 1 个字符
  • 按推理时间计费:根据使用约 25 段约 500 字符文本的基准测试运行结果进行估算
  • 开放权重:列出时不含价格;若该模型同时通过付费 API 提供,则采用该定价
  • 语音到语音模型:根据为 20 条固定的 TTS 竞技场提示词生成语音的成本推算,依据的是所报告的文本输入、输出音频、输出文本,以及单独披露的推理/思考 token。当输出文本 token 被作为音频响应的一部分进行报告时,会将其计入。我们不考虑缓存带来的影响,因为这些提示词是作为单轮请求独立运行的,其对价格的影响可以忽略不计。

吞吐量

服务商每秒将输入文本转换为语音的字符数中位数,基于过去 3 天的测量值计算。每次生成时,我们以提示词的字符数除以生成并接收该片段所用的时间。

当接口返回的是 URL 而非音频数据时,该测量也包含从服务商下载音频片段的时间。这是为了反映终端用户实际接收生成音频片段的体验,因为 URL 可能在音频生成完成之前就已签发。在适用情况下,音频片段以批大小 1 生成。

基准测试每天进行 4 次。在每一次基准测试评估中,我们为每个模型随机选择一个音色。每次生成都使用一条约 500 字符的独特提示词。

竞技场的运作方式

每次对比都会呈现由同一段文本提示生成的两个音频片段。在服务商音色竞技场中,两个片段使用同一性别与口音类别的音色;在受控音色竞技场中,两个片段使用同一克隆参考音色。模型名称在投票前保持隐藏,呈现顺序随机排列,且听众必须播放每个片段的最低时长后才能投票。投票为二选一,不设平局选项。提示词涵盖四个类别(客户服务、娱乐、知识分享与助手场景),并包含字母数字串、数字序列等高难度素材,提示词集合也会不断更新。

音频样本按模型只生成一次,并在进入竞技场前完成标准化。因此,针对同一模型的投票始终基于一组一致的样本,这些样本在上线前可以经过检查和归一化处理。所有片段都会转换为统一的播放格式,并归一化到相同的响度目标,从而确保服务商之间的音量或编码差异不会影响投票。

受控音色竞技场

受控音色竞技场使用声音克隆技术,来统一评测各个文本转语音模型时所使用的音色。通过使用相同的参考音色来比较模型,可以将听众对某一特定音色的偏好,与模型质量的更广泛方面区分开来,例如语音自然度、音频质量、发音、节奏与韵律。这使得对底层文本转语音模型的比较更为对等。

对于受控音色竞技场,英语参考音色集包含 8 个由专业录制的音色:2 个美国女声、2 个美国男声、2 个英国女声和 2 个英国男声。对于接受完整参考录音的模型,包括会自行裁剪录音的模型,我们提供完整录音。对于限制参考音频长度的模型,我们则提供较短版本,通常为 5 至 10 秒或 10 至 15 秒,并在自然停顿处截断。

除英语外,受控音色竞技场还评测西班牙语、法语、德语、葡萄牙语、日语、印地语、普通话、阿拉伯语和越南语模型。对于每种非英语语言,参考音色集包括一个由母语者专业录制的男声和一个女声。在每种语言内部,同样使用声音克隆来统一音色,而偏好投票由经过筛选的评测者提供,以确保所评测的语言是其第一语言。每个模型仅在其支持的语言中接受评测,当模型积累了足够的比较次数、能够产生稳定的 Elo 评分后,才会发布该语言的专属排行榜。

受控音色竞技场是对我们服务商音色竞技场的补充。在服务商音色竞技场中,每个模型使用其自身公开可用音色中一组具有代表性的音色进行评测。

请在下方选择一个受控音色,收听其参考录音。

服务商音色竞技场

服务商音色竞技场使用该模型服务商所提供音色中一组具有代表性的音色,来评测每个文本转语音模型。这是对受控音色竞技场的补充——在后者中,模型使用相同的克隆参考音色进行比较。服务商音色反映了用户通过模型自身的公开 API、产品界面或文档实际体验到该模型的典型方式。

对于每个模型,我们会选择多个由服务商提供的音色,以使比较具有代表性且公平。我们为男声与女声、美国口音与英国口音的每一种组合各选择 2 个音色,共计 8 个音色。若某一性别与口音的组合不可用,我们会在服务商音色竞技场的评测中排除该组合。

音色的选择依据其在服务商界面和文档中的突出程度,并排除本身不够中性的音色(例如风格化程度很高的地方口音)。在可选音色较多的情况下,模型开发商也可以要求我们使用特定音色。若未提供服务商音色(开放权重模型通常如此),我们会使用专业配音演员的语音片段作为生成语音的源文件(示例见上文“受控音色竞技场”)。

请在下方选择一个模型开发商,查看其各个模型当前所使用的服务商音色。

投票者质量

我们发布的评分大多来自付费小组,其成员在同类项目中均有良好记录,涵盖竞技场偏好投票与 Pronunciation Robustness 评审两类工作。英语竞技场与 Pronunciation Robustness 的小组成员须为居住在美国或英国的英语母语者。对于受控音色竞技场中的每一种非英语语言,我们按第一语言筛选成员,并在条件允许的情况下选择居住在其原籍国的评测者,确保评审是所评测语言的母语者。

Pronunciation Robustness 的评测会话包含答案已知的注意力检查剪辑,凡答错任何已作答检查的评审都会被完全剔除。竞技场的投票在计入排名前需通过自动质量筛查。付费评审全程看不到模型名称。我们还会持续比较付费与公众两个来源的排名,作为一致性核查。

模型与服务商收录标准

我们的目标是分析和比较热门且表现优异的文本转语音模型与服务商,以帮助终端用户选择使用哪一个。为此,我们采用“行业重要性”和竞争力表现测试来评估是否收录新的模型与服务商。我们正在完善这些标准,欢迎任何反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。当服务商公开发布某一模型的重要更新时,我们会将其作为带日期的新变体单独列出,重新生成其全部竞技场样本,并在不沿用既有投票的情况下为其排名。此前的变体只要仍符合收录条件,就会继续列出。

独立性声明

基准测试在严格独立与客观的前提下进行。我们不会因在 Artificial Analysis 上被收录或获得有利结果而从任何服务商处收取报酬。