音乐生成基准测试方法论
范围与背景
Artificial Analysis 对通常以 Serverless(无服务器)API 接入点形式提供的音乐生成模型进行基准测试。本页介绍我们通过 Artificial Analysis 音乐竞技场中的人类偏好投票来衡量模型质量所使用的方法论。
在音乐生成能力方面,我们涵盖两种模态:
- 纯音乐(Instrumental): 生成不含人声的音乐的模型。
- 人声(Vocals): 生成带有演唱或口白人声元素的音乐的模型。
我们对所有模型和服务商生成的每首曲目均应用一套标准的默认设置,以使输出尽可能具有可比性。这些设置列于下方的“默认生成设置”部分。
质量 Elo
每个模型的 Elo 分数反映其相对质量,来源于用户在 Artificial Analysis 音乐竞技场中的投票。我们使用 Bradley-Terry 最大似然估计计算评分,并将其重新缩放至类 Elo 区间以便于阅读。这与我们在图像竞技场和视频竞技场中使用的方法论相同。每个评分旁会同时给出 95% 置信区间,随着模型获得更多投票,该区间会逐渐收窄。
在竞技场中,用户仅比较同一模态内的曲目。Elo 按每种模态分别报告,并进一步按曲风细分。
竞技场投票
质量 Elo 完全来自盲测的成对人类偏好投票。在每次比较中,用户会看到根据同一条提示词、在同一模态下生成的两首曲目,收听两者后选出更偏好的一首。
- 收听要求: 只有在用户对每首曲目至少收听 10 秒后才能投票,以确保偏好反映的是整体音频输出,而非第一印象。
- 盲测: 在投票完成之前,模型名称、标识以及任何可识别身份的细节均会隐藏。
音频归一化
在曲目进入竞技场之前,我们会将每首曲目归一化到统一的响度和交付格式,以确保投票反映的是音乐质量,而非音量或文件特性的差异。
- 响度: 每首曲目通过一次静态增益调整,被调整至 -16 LUFS 的整体响度目标(ITU-R BS.1770);增益提升以 -1 dBTP 的真峰值上限为界以防止削波,因此余量不足的曲目会略低于该目标。我们不施加压缩、限幅或均衡(EQ),因此每首曲目的动态和音色平衡都得以保留。
- 交付格式: 无论服务商返回何种格式,每首曲目都会重新编码为 320 kbps、44.1 kHz 的 MP3,并移除服务商元数据和内嵌封面图。原始声道布局(单声道或立体声)予以保留。
排行榜
我们为每种模态发布全球排行榜和个人排行榜。
- 全球排行榜: 汇总所有用户中全部符合条件的投票。模型在获得最低数量的投票后即会出现在榜单上。
- 个人排行榜: 根据单个用户自己的投票构建的排名。用户投出最低数量的投票后即可解锁,在其投票数量尚不足以形成可靠排名之前会显示低置信度提示。
两个排行榜均可另外按曲风筛选。
提示词与曲风
提示词取自一套涵盖多种音乐风格的精选可复现提示词集,并辅以用户提交的提示词(长度介于 25 至 200 个字符之间),这些提示词经我们审核后才会加入轮换池。
每条提示词都会标记一个曲风,例如流行(Pop)、嘻哈/说唱(Hip-Hop / Rap)、电子(EDM)、古典/管弦(Classical / Orchestral)以及爵士与蓝调(Jazz & Blues)。我们使用同样的 Bradley-Terry 方法,在每种模态的总体排名之外计算按曲风划分的 Elo 排名,并在该曲风积累到足够有意义的投票量后予以展示。
默认生成设置
除非另有说明,以下设置同时适用于纯音乐和人声基准测试。
| 设置项 | 值 |
|---|---|
| 每条提示词生成曲目数 | 1 |
| 时长 | 约 3 分钟(或最接近的受支持时长;当模型仅输出固定时长时,采用该时长) |
| 音频格式 | 可配置时使用 MP3,否则采用服务商默认值 |
| 采样率 | 可配置时使用 44.1 kHz,否则采用服务商默认值 |
| 种子值 | 42(当服务商公开种子参数时) |
| 歌词 | 由模型根据提示词生成(人声模态);纯音乐模态不适用 |
| 人声 | 纯音乐模态关闭;人声模态开启 |
不同音乐模型公开的参数差异很大。当服务商不支持某项默认值时,我们使用最接近的受支持值或服务商的默认值。对于每个模型,音乐竞技场所用的全部生成过程均保持设置不变。
纯音乐(Instrumental)
纯音乐模型生成不含人声的音乐。只有当模型的接入点能够产出纯音乐输出时,我们才会在纯音乐模态下对其进行基准测试,例如通过 instrumental 开关,或通过可抑制人声的风格与负向提示词控制项。如果某个接入点无法将纯音乐生成与人声生成区分开,我们就只在人声模态下对该模型进行基准测试。
人声(Vocals)
只有当模型能够根据一条提示词自行生成歌词和人声时,我们才会在该模态下对其进行基准测试。我们不提供歌词,因此该基准测试反映的是每个模型端到端的词曲创作能力。
模型与服务商收录标准
我们的目标是分析和比较热门且高性能的音乐生成模型,帮助用户做出选择。为此,我们根据行业重要性和竞争力表现评估是否收录新的模型与服务商。我们持续优化这些标准,欢迎反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。
独立性声明
基准测试以严格的独立性和客观性进行。Artificial Analysis 不接受任何服务商为获得上榜或有利结果而提供的报酬。