视频生成基准测试方法论

范围与背景

Artificial Analysis 对通常以 Serverless(无服务器)API 接入点形式提供的视频生成模型进行基准测试。本页介绍用于衡量视频生成模型质量、速度和价格的方法论。

在视频生成能力方面,我们发布六项基准测试:

  • AA-Video-T2V-Silent v2.0: 仅根据文本提示词生成视频的模型。
  • AA-Video-I2V-Silent v1.0: 使用参考图像作为首帧生成视频的模型,在支持的情况下还可附带文本提示词。
  • AA-Video-Editing-Silent v1.0: 根据视频输入和文本提示词生成视频的模型。
  • AA-Video-T2V v2.0: 在生成视频的同时生成同步音频的文生视频模型。
  • AA-Video-I2V v1.0: 在生成视频的同时生成同步音频的图生视频模型。
  • AA-Video-Editing v1.0: 在生成视频的同时生成同步音频的视频编辑模型。

每项基准测试在视频竞技场中拥有独立的 Elo 评分池,因此静音输出与含音频输出不会直接比较,编辑与生成也不会相互比较。

我们对所有模型和服务商生成的每段视频均应用一套标准的默认设置。我们使用每个模型在相同设置下生成的视频进行比较,设置涵盖分辨率、帧率、时长、宽高比、种子值、引导系数和推理步数,以确保可比性。完整的默认设置列于下方的“默认生成设置”部分。

接入点覆盖范围

覆盖的工作负载:推理基准测试覆盖文生视频和图生视频生成接入点。

仅限公开 Serverless 接入点:基准测试覆盖已经或即将公开可用的真正 Serverless 接入点。演示产品、硬件展示以及专用或私有部署不在范围之内。

标准与修改版接入点

我们将每个接入点分类为标准——以完整保真度提供原生模型服务,并公开其标准输入参数——或修改版——相对于原生模型进行了影响输出保真度的改动,通常是为了提升生成速度或降低成本。

修改版接入点在 Artificial Analysis 上标注为“修改版”,并可能在排行榜默认视图中被隐藏,仅对选择显示的用户可见。为维护我们默认基准测试的公平性,我们保留对接入点是否归类为修改版的裁定权——判定指标包括蒸馏、原生模型输入参数的部分暴露或输出质量的实质性下降——以及对同一模型列出多少变体的裁定权。

关键指标

我们使用以下指标追踪视频生成模型的质量、性能和价格。

质量 Elo

每个模型的 Elo 分数反映其相对质量,来源于我们招募的评审面板的盲测投票,以及 2026 年 1 月 1 日之前在 Artificial Analysis 视频竞技场投出的公开投票。两种来源都由投票者比较由不同模型根据同一提示词生成的两段视频,并选择更优者。该日期之前的公开投票仅存在于文生视频和图生视频,且现在仅计入图生视频:文生视频基准测试已为 v2.0 重置(参见下方“AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0”部分)。视频编辑以及三种含音频的模态的首次公开投票都在该日期之后,因此其分数仅来自评审面板的投票。我们使用 Bradley-Terry 最大似然估计对这些成对投票进行汇总,并将其重新缩放至类 Elo 区间以便于阅读。评分每小时重新计算一次。

Elo 按每项基准测试分别报告(AA-Video-T2V-Silent v2.0、AA-Video-I2V-Silent v1.0、AA-Video-Editing-Silent v1.0、AA-Video-T2V v2.0、AA-Video-I2V v1.0、AA-Video-Editing v1.0),因为竞技场对局仅在同一模态的输出之间进行。

排行榜

我们为每项基准测试发布一个全球排行榜。AA-Video-T2V v2.0 和 AA-Video-T2V-Silent v2.0 还发布类别排行榜(见下文)。

  • 全球排行榜:本站发布的排名,汇总上述规则保留下来的全部投票。模型在获得最低投票数后即会列入。

每分钟视频价格

在默认生成设置下,服务商生成一分钟视频的价格(美元)。

价格直接取自各服务商公布的按分钟计费费率。

生成时间

在默认生成设置下,服务商生成单段视频所需时间的中位数,基于过去 3 天的数据计算。

生成时间为端到端测量:从请求提交给服务商的那一刻起,经过所有队列等待时间、推理与视频编码,直至从服务商下载完成的视频。对于异步 API(提交 → 轮询 → 下载),该时间包括全部三个阶段。

对于图生视频模型,生成时间还包括将参考图像上传到服务商所需的时间。对于接受参考图像 URL 的服务商,不存在上传步骤,生成时间不包含图像上传。

默认生成设置

除非另有说明,以下设置同时适用于文生视频和图生视频基准测试。

设置项值
分辨率1080p(或最接近的受支持值)
帧率24 FPS(或最接近的受支持值)
时长10 秒(或当时长必须以帧数指定时,等效的帧数)
宽高比16:9 横向
种子值42(当模型公开种子参数时)
提示词增强当模型开发商建议启用时开启,否则关闭
CFG / 引导系数第一方 API 默认值,或开源仓库默认值
推理步数第一方 API 默认值,或开源仓库默认值

当服务商不支持精确的默认值时,我们使用最接近的受支持值,平局时向上取值(例如,当 24 FPS 不可用时,我们优先选择 30 FPS 而非 18 FPS,因为两者与默认值的距离相同)。AA-Video-T2V v2.0 和 AA-Video-I2V v1.0 在启用音频输出的情况下对模型进行基准测试;其余所有默认设置照常适用。

文生视频

文生视频模型仅以文本提示词作为输入。提示词取自精选的可复现提示词集。

图生视频

图生视频模型以参考图像作为输入,在支持的情况下还可附带文本提示词。我们基准测试中使用的参考图像遵循以下标准:

  • 格式: PNG(无损)。我们不使用 JPG/JPEG,以避免有损编码可能引入的压缩伪影。
  • 分辨率: 1920×1080(16:9,与目标视频分辨率一致)。
  • 字节回退: 当服务商不接受 URL 或要求特定尺寸或格式时,我们下载图像、进行所需的转换,然后直接上传字节数据。
  • 上传时间: 当服务商要求我们在生成前将图像上传到其平台时,该上传时间计入生成时间。

AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0

方法论概述

文生视频模型在不同用例上能力各不相同。有的模型可能在真人表演与口型同步上领先,有的则擅长动画、画面文字或 UI 动效。制作公司为品牌短片选择的模型,未必是产品团队制作 UI 动效演示或创作者制作社交短视频所用的模型。

我们的方法论直接衡量这种差异。我们基于一套由真实用例与模型能力构成的分类体系,按人类偏好对模型排名,找出整体最好的模型以及最适合特定工作的模型。我们定期更新提示词集,使排行榜能持续测量不断前移的前沿。

AA-Video-T2V v2.0 评判带音频的文生视频。AA-Video-T2V-Silent v2.0 评判无音频的文生视频。

提示词的策划与更新

我们维护一套经过策划的提示词集,并定期更新,以随模型能力演进追踪前沿。

  • 提示词分类体系:每条提示词都依照真实用例与模型能力两条轴线撰写,并同时打上两类标签。每条提示词还带有视觉风格标签。竞技场中的提示词在用例与能力上均匀抽样。
  • 提示词集:AA-Video-T2V v2.0 使用 1,000 条提示词。AA-Video-T2V-Silent v2.0 使用 500 条提示词。
  • 时效性:我们定期更新提示词集。当提示词不再能区分模型,或不再反映当下人们对视频模型的提示方式时,即予以退役。

提示词分类体系

我们沿两条轴线构建提示词分类体系,并单独标注视觉风格。

用例。这些用例基于我们对消费者与企业采用文生视频的分析,以及对新兴用例的观察。各用例的示例任务包括:

  • Marketing & Advertising:动态海报、Logo 片头、品牌短片、主打产品广告、发布视频
  • Retail & E-commerce:棚拍产品镜头、产品演示、服装与时尚动态、创作者风格的推荐视频、穿搭试穿
  • Live-Action Film:电影级镜头、微短剧剧集、预演
  • Animation & Gaming:动画场景、游戏预告片、动画与游戏的预演
  • Architecture & Real Estate:外景飞越、室内漫游、虚拟布景
  • Productivity & Knowledge Work:讲解视频、教育与培训视频、动态数据可视化、情景模拟
  • UI/UX & Motion Design:动态字体排印、跨设备的 UI 动效演示、抽象动态图形
  • Consumer:自拍、个人时刻、日常素材视频与空镜
  • Social Media & Creator Content:口播视频、播客片段、ASMR 与解压视频、舞蹈、Vlog、热门形式
  • Frontier:当前前沿及其之外的能力

能力。这些模型能力来自我们与领先模型实验室的持续合作及其正在攻关的方向,并以学术基准为依托。各能力的示例包括:

  • Physics:力学、热效应、材料相互作用、断裂与形变、光学、因果关系、反事实物理
  • Complex Composition:属性绑定、空间关系、多物体互动、计数、时间顺序
  • Human Anatomy:步态与移动、精细动作、面部表情、杂技动作、物体抓握、人际互动
  • Lighting & Materials:光照、曝光、阴影、色温、纹理、布料、头发与皮毛
  • Multi-Scene & Narrative:多事件故事、镜头转场、蒙太奇、跨镜头的身份一致性
  • Camera Control:特写、航拍、POV 与低角度等镜头类型,以及跟拍、推轨、环绕、摇臂、急推变焦、甩镜头与移焦等运镜
  • Text Rendering:短文本与长文本、二维版式、非词汇字符串、变形表面上的文字
  • Spatio-Temporal Consistency:空间连贯性、延时摄影、遮挡与重新入画、单镜头叙事
  • Audio Synchronization:画内音效、背景音乐与配乐、画内与画外声音
  • Dialogue & Lip Sync:单人与多人对白、画外旁白与画面内说话

风格。每条提示词还带有八种视觉风格之一的标签:Photorealistic、3D Render/CGI、Cartoon and Anime、Flat Design、Hand-drawn/Illustration、Stop-Motion/Claymation、Lo-Fi 与 Mixed Styles。风格并非均匀抽样,大多数提示词为照片级写实风格。

提示词编写

前沿视频模型已能很好地处理简单请求,我们编写提示词正是为了区分这些模型。提示词的编写目标是:

  • 完整覆盖分类体系,在每个用例与能力组合上均匀分布,并在每项能力上设定较高的复杂度下限,例如大幅而非细微的动作,以及多个相互作用的主体。
  • 反映真实的制作工作,参考模型开发商的提示词指南、我们现有的提示词集,以及我们在整个行业中观察到的工作流程。
  • 兼顾声音,针对 AA-Video-T2V v2.0:在场景需要时,提示词会指定对白、音效、环境声与音乐。

每条提示词在投放到竞技场之前都由人工审核。

提示词退役

当竞技场投票显示提示词已不再能区分模型,或提示词已不再反映人们对视频模型的提示方式时,我们会将其退役。

抽样方法

每场对决先在用例与能力组合上均匀抽样,再在选定组合内随机抽取一条提示词。

每场对决都由同一条提示词在同一基准测试内生成的两段视频配对,因此含音频的视频绝不会与无声视频配对。左右位置随机分配。

播放标准

我们按以下统一标准向评审者呈现每段视频:

  • 分辨率:最高 1080p,按生成原样呈现。视频从不进行放大:无法生成 1080p 的模型以其支持的最高分辨率呈现,高于 1080p 的输出则缩小至 1080p。
  • 编码:高质量 H.264,峰值码率上限为 10 Mbps。
  • 时长:10 秒,16:9。无法生成 10 秒的模型以其最大时长呈现。
  • 音频响度统一:对于 AA-Video-T2V v2.0,我们以单一固定增益将每段视频的响度向 -18 LUFS 调整。模型的混音从不经过压缩或重新母带处理,任何模型都无法靠更大的音量胜出。

Elo 计算

投票收集

模型质量以人类偏好来衡量。

  • 盲测两两投票:评审者观看同一条提示词由两个不同模型生成的两段视频(不显示模型身份),选出更喜欢的一段。两段视频在同一播放器中以全尺寸播放,评审者可在两者之间切换。
  • 评判提示:每场对决展示与该提示词的用例、主要能力和风格绑定的简短提示,把注意力引向受测的具体方面。
  • 最短交互门槛:只有在每段视频播放至少 8 秒后才能投票。对于 AA-Video-T2V v2.0,评审者还需佩戴耳机对声音进行评判。
  • 投票质量:两个排行榜均仅基于我们招募的评审面板的投票进行排名,评审者由面板供应商完成筛选与身份核验。每个会话中约五分之一的对决是具有明确共识答案的质量检查。未通过这些检查的会话将被拒绝,其全部投票均被移除;质量检查投票本身不计入评分。

投票过滤

AA-Video-T2V v2.0 和 AA-Video-T2V-Silent v2.0 是全新的排行榜。对于所有模型,我们将本次更新之前投出的全部文生视频投票退役,因为这些投票是在早期的提示词与播放标准下收集的。视频竞技场的公开投票不计入这些评分。我们在保留的投票上从零计算 Elo,以 Kling 3.0 1080p (Pro) = 1000 作为整体排行榜和所有子类别排行榜的锚点。

排行榜

对于每项基准测试,我们发布:

  • 整体排行榜:基于全部保留投票的排名。模型在获得最低投票数后即会列入。
  • 类别排行榜:同样的计算,仅限于带有特定用例、能力或风格标签的提示词,在该类别获得足够投票后发布。

生成时间测试方法论

关键技术细节:

  • 测试频率: 文生视频每2小时运行一次,每个时间窗口内的运行时间随机。
  • 样本量: 发布的生成时间为过去 3 天内成功测量值的中位数。每 2 小时测量一次,文生视频通常在每个窗口期内为每个托管模型积累约 36 个样本。
  • 提示词选取: 每次运行从精选数据库池中随机抽取一条提示词,并将其提交给每个活跃的托管模型。
  • 种子值: 当模型公开种子参数时,使用固定种子值 42,以确保不同次运行之间的输出可复现。
  • 端到端计时: 生成时间从首次 API 调用到视频下载完成进行端到端测量。对于使用异步 API 的服务商(提交、轮询、下载),该时间包括队列等待、推理和下载。
  • API 模式: 我们每 100 毫秒轮询一次任务状态,以确保测得的队列等待时间反映服务商的实际耗时,而非轮询粒度。
  • 测量范围: 生成时间目前仅针对静音的文生视频和图生视频模型进行测量。AA-Video-Editing-Silent v1.0 及三项含音频基准测试(AA-Video-T2V v2.0、AA-Video-I2V v1.0、AA-Video-Editing v1.0)通过视频竞技场(质量 Elo)进行排名,但目前不进行延迟基准测试。
  • 聚合方式: 中位数、p05、p25、p75 和 p95 均根据成功测量值的原始分布计算,不进行离群值裁剪。
  • 未测量内容: 服务商冷启动延迟、身份验证握手、重试开销以及任何客户端预热。数据集中的每条记录均为单次一次性测量。
  • 基础设施: 运行于 Google Cloud Run 的 us-central1 区域。
  • 新接入点: 对于新增的接入点(包括在公开可用之前即已纳入基准测试的接入点),我们可能会调整测试频率以在结果上线前建立生成时间的分布。已发布的结果基于过去 3 天的测量数据计算,因此新上线接入点的数据反映的是初始运行结果,随着更多测量数据的积累,数值可能会发生变化。

模型与服务商收录标准

我们的目标是分析和比较热门且高性能的视频生成模型,帮助用户做出选择。为此,我们根据行业重要性和竞争力表现评估是否收录新的模型与服务商。我们持续优化这些标准,欢迎反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。

独立性声明

基准测试以严格的独立性和客观性进行。Artificial Analysis 不接受任何服务商为获得上榜或有利结果而提供的报酬。