视频生成基准测试方法论

范围与背景

Artificial Analysis 对通常以 Serverless(无服务器)API 接入点形式提供的视频生成模型进行基准测试。本页介绍用于衡量视频生成模型质量、速度和价格的方法论。

在视频生成能力方面,我们涵盖六种模态:

  • 文生视频: 仅根据文本提示词生成视频的模型。
  • 图生视频: 使用参考图像作为首帧生成视频的模型,在支持的情况下还可附带文本提示词。
  • 视频编辑: 根据视频输入和文本提示词生成视频的模型。
  • 含音频文生视频: 在生成视频的同时生成同步音频的文生视频模型。
  • 含音频图生视频: 在生成视频的同时生成同步音频的图生视频模型。
  • 含音频视频编辑: 在生成视频的同时生成同步音频的视频编辑模型。

每种模态在视频竞技场中拥有独立的 Elo 评分池,因此静音输出与含音频输出不会直接比较,编辑与生成也不会相互比较。

我们对所有模型和服务商生成的每段视频均应用一套标准的默认设置。我们使用每个模型在相同设置下生成的视频进行比较,设置涵盖分辨率、帧率、时长、宽高比、种子值、引导系数和推理步数,以确保可比性。完整的默认设置列于下方的“默认生成设置”部分。

接入点覆盖范围

覆盖的工作负载:推理基准测试覆盖文生视频和图生视频生成接入点。

仅限公开 Serverless 接入点:基准测试覆盖已经或即将公开可用的真正 Serverless 接入点。演示产品、硬件展示以及专用或私有部署不在范围之内。

标准与修改版接入点

我们将每个接入点分类为标准——以完整保真度提供原生模型服务,并公开其标准输入参数——或修改版——相对于原生模型进行了影响输出保真度的改动,通常是为了提升生成速度或降低成本。

修改版接入点在 Artificial Analysis 上标注为“修改版”,并可能在排行榜默认视图中被隐藏,仅对选择显示的用户可见。为维护我们默认基准测试的公平性,我们保留对接入点是否归类为修改版的裁定权——判定指标包括蒸馏、原生模型输入参数的部分暴露或输出质量的实质性下降——以及对同一模型列出多少变体的裁定权。

关键指标

我们使用以下指标追踪视频生成模型的质量、性能和价格。

质量 Elo

每个模型的 Elo 分数反映其相对质量,来源于用户在 Artificial Analysis 视频竞技场中的投票。在竞技场中,用户比较由不同模型根据同一提示词生成的两段视频,并选择更优者。我们使用 Bradley-Terry 最大似然估计对这些成对投票进行汇总,并将其重新缩放至类 Elo 区间以便于阅读。评分每小时重新计算一次。

Elo 按每种模态分别报告(文生视频、图生视频、视频编辑、含音频文生视频、含音频图生视频、含音频视频编辑),因为竞技场对局仅在同一模态的输出之间进行。

每分钟视频价格

在默认生成设置下,服务商生成一分钟视频的价格(美元)。

价格直接取自各服务商公布的按分钟计费费率。

生成时间

在默认生成设置下,服务商生成单段视频所需时间的中位数,基于过去 14 天的数据计算。

生成时间为端到端测量:从请求提交给服务商的那一刻起,经过所有队列等待时间、推理与视频编码,直至从服务商下载完成的视频。对于异步 API(提交 → 轮询 → 下载),该时间包括全部三个阶段。

对于图生视频模型,生成时间还包括将参考图像上传到服务商所需的时间。对于接受参考图像 URL 的服务商,不存在上传步骤,生成时间不包含图像上传。

默认生成设置

除非另有说明,以下设置同时适用于文生视频和图生视频基准测试。

设置项
分辨率1080p(或最接近的受支持值)
帧率24 FPS(或最接近的受支持值)
时长10 秒(或当时长必须以帧数指定时,等效的帧数)
宽高比16:9 横向
种子值42(当模型公开种子参数时)
提示词增强当模型开发商建议启用时开启,否则关闭
CFG / 引导系数第一方 API 默认值,或开源仓库默认值
推理步数第一方 API 默认值,或开源仓库默认值

当服务商不支持精确的默认值时,我们使用最接近的受支持值,平局时向上取值(例如,当 24 FPS 不可用时,我们优先选择 30 FPS 而非 18 FPS,因为两者与默认值的距离相同)。含音频文生视频和含音频图生视频子模态在启用音频输出的情况下对模型进行基准测试;其余所有默认设置照常适用。

文生视频

文生视频模型仅以文本提示词作为输入。提示词取自精选的可复现提示词集。

图生视频

图生视频模型以参考图像作为输入,在支持的情况下还可附带文本提示词。我们基准测试中使用的参考图像遵循以下标准:

  • 格式: PNG(无损)。我们不使用 JPG/JPEG,以避免有损编码可能引入的压缩伪影。
  • 分辨率: 1920×1080(16:9,与目标视频分辨率一致)。
  • 字节回退: 当服务商不接受 URL 或要求特定尺寸或格式时,我们下载图像、进行所需的转换,然后直接上传字节数据。
  • 上传时间: 当服务商要求我们在生成前将图像上传到其平台时,该上传时间计入生成时间。

生成时间测试方法论

关键技术细节:

  • 测试频率: 文生视频每天在随机时间运行一次。
  • 样本量: 发布的生成时间为过去 14 天内成功测量值的中位数。按每日频率,文生视频通常在每个窗口期内为每个托管模型积累约 14 个样本。
  • 提示词选取: 每次运行从精选数据库池中随机抽取一条提示词,并将其提交给每个活跃的托管模型。
  • 种子值: 当模型公开种子参数时,使用固定种子值 42,以确保不同次运行之间的输出可复现。
  • 端到端计时: 生成时间从首次 API 调用到视频下载完成进行端到端测量。对于使用异步 API 的服务商(提交、轮询、下载),该时间包括队列等待、推理和下载。
  • API 模式: 我们每 100 毫秒轮询一次任务状态,以确保测得的队列等待时间反映服务商的实际耗时,而非轮询粒度。
  • 测量范围: 生成时间目前仅针对静音的文生视频和图生视频模型进行测量。视频编辑及三种含音频模态(含音频文生视频、含音频图生视频、含音频视频编辑)通过视频竞技场(质量 Elo)进行排名,但目前不进行延迟基准测试。
  • 聚合方式: 中位数、p05、p25、p75 和 p95 均根据成功测量值的原始分布计算,不进行离群值裁剪。
  • 未测量内容: 服务商冷启动延迟、身份验证握手、重试开销以及任何客户端预热。数据集中的每条记录均为单次一次性测量。
  • 基础设施: 运行于 Google Cloud Run 的 us-central1 区域。
  • 新接入点: 对于新增的接入点(包括在公开可用之前即已纳入基准测试的接入点),我们可能会调整测试频率以在结果上线前建立生成时间的分布。已发布的结果基于过去 14 天的测量数据计算,因此新上线接入点的数据反映的是初始运行结果,随着更多测量数据的积累,数值可能会发生变化。

模型与服务商收录标准

我们的目标是分析和比较热门且高性能的视频生成模型,帮助用户做出选择。为此,我们根据行业重要性和竞争力表现评估是否收录新的模型与服务商。我们持续优化这些标准,欢迎反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。

独立性声明

基准测试以严格的独立性和客观性进行。Artificial Analysis 不接受任何服务商为获得上榜或有利结果而提供的报酬。