動画生成ベンチマークの方法論
対象範囲と背景
Artificial Analysisでは、通常サーバーレスAPIエンドポイントを介して提供される動画生成モデルをベンチマークしています。このページでは、動画生成モデルの品質、速度、料金を測定する方法を説明します。
動画生成機能について、次の6つのベンチマークを公開しています。
- AA-Video-T2V-Silent v2.0: テキストプロンプトのみから動画を生成するモデル。
- AA-Video-I2V-Silent v1.0: 参照画像を最初のフレームとして使い、対応している場合はテキストプロンプトも併用して動画を生成するモデル。
- AA-Video-Editing-Silent v1.0: 入力動画とテキストプロンプトから動画を生成するモデル。
- AA-Video-T2V v2.0: 動画と同時に同期音声を生成するテキストから動画生成モデル。
- AA-Video-I2V v1.0: 動画と同時に同期音声を生成する画像から動画生成モデル。
- AA-Video-Editing v1.0: 動画と同時に同期音声を生成する動画編集モデル。
Video Arenaではベンチマークごとに独立したEloプールを設けています。そのため、無音出力と音声付き出力を直接比較することはなく、編集と生成も比較しません。
すべてのモデルとプロバイダーで生成する各動画に、標準のデフォルト設定を適用します。比較可能性を確保するため、解像度、フレームレート、長さ、アスペクト比、シード、ガイダンス、推論ステップなど、モデルごとに同一の設定で生成した動画を使用します。デフォルト設定の全項目は、後述の「デフォルト生成設定」に記載しています。
エンドポイントの対象範囲
対象ワークロード:推論ベンチマークでは、テキストから動画生成と画像から動画生成のエンドポイントを対象とします。
公開サーバーレスエンドポイントのみ:現在または今後一般公開される、実際にサーバーレスであるエンドポイントを対象とします。デモ製品、ハードウェア展示、専用または非公開のデプロイは対象外です。
Standard/Modifiedエンドポイント
各エンドポイントを、ネイティブモデルを完全な忠実度で提供し、標準の入力パラメーターを公開するStandard(標準)、または通常は生成速度の向上やコスト削減を目的に、出力の忠実度へ影響する形でネイティブモデルから変更されたModified(変更済み)のいずれかに分類します。
ModifiedエンドポイントにはArtificial Analysis上で「Modified」と表示し、デフォルトのリーダーボード表示では非表示にする場合があります。表示を選択したユーザーは引き続き確認できます。デフォルトベンチマークの公平性を保つため、蒸留、ネイティブモデルの入力パラメーターの一部のみの公開、出力品質の大幅な低下などを指標として、エンドポイントをModifiedに分類するかどうか、および同一モデルのバリエーションをいくつ掲載するかは、当社の裁量で決定します。
主要指標
動画生成モデルの品質、性能、料金を追跡するため、次の指標を使用します。
品質Elo
各モデルのEloスコアは、当社が募集したパネルによるブラインド投票と、2026年1月1日より前にArtificial AnalysisのVideo Arenaで投じられた一般投票から算出した相対的な品質を示します。どちらの投票でも、異なるモデルが同じプロンプトから生成した2本の動画を比較し、投票者が好む方を選びます。この日より前の一般投票は、テキストから動画生成と画像から動画生成にのみ存在し、現在は画像から動画生成でのみ算入されます。テキストから動画生成のベンチマークはv2.0でリセットされたためです(後述のAA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0を参照)。動画編集と音声付きの3つのモダリティは最初の一般投票がこの日より後のため、スコアはパネルの投票のみに基づきます。この一対比較の投票をBradley-Terry最尤推定で集計し、読みやすいElo相当の範囲に再スケーリングします。レーティングは1時間ごとに再計算されます。
Arenaでは同じモダリティの出力同士のみを組み合わせるため、Eloはベンチマーク(AA-Video-T2V-Silent v2.0、AA-Video-I2V-Silent v1.0、AA-Video-Editing-Silent v1.0、AA-Video-T2V v2.0、AA-Video-I2V v1.0、AA-Video-Editing v1.0)ごとに個別に報告します。
リーダーボード
ベンチマークごとにグローバルリーダーボードを1つ公開しています。AA-Video-T2V v2.0とAA-Video-T2V-Silent v2.0では、カテゴリー別リーダーボードも公開しています(後述を参照)。
- グローバルリーダーボード:本サイトで公開している順位で、上記のルールで保持されたすべての投票を集計します。モデルは最低限の投票数に達すると掲載されます。
動画1分あたりの料金
デフォルト生成設定で1分間の動画を生成する際のプロバイダー料金(USD)です。
料金は、各プロバイダーが公開している1分あたりの料金をそのまま使用します。
生成時間
デフォルト生成設定で動画1本を生成するためにプロバイダーが要する時間の中央値です。過去3日間のデータから算出します。
生成時間は、プロバイダーへのリクエスト送信時点から、キュー待機、推論、動画エンコードを経て、完成した動画をプロバイダーからダウンロードするまでをエンドツーエンドで測定します。非同期API(送信→ポーリング→ダウンロード)では、この3つのフェーズをすべて含みます。
画像から動画生成モデルでは、参照画像をプロバイダーへアップロードするために必要な時間も生成時間に含めます。参照画像のURLを受け付けるプロバイダーにはアップロード工程がないため、生成時間に画像のアップロードは含まれません。
デフォルト生成設定
特に記載がない限り、これらの設定をテキストから動画生成と画像から動画生成の両方のベンチマークに適用します。
| 設定 | 値 |
|---|---|
| 解像度 | 1080p(または対応する最も近い値) |
| フレームレート | 24 FPS(または対応する最も近い値) |
| 長さ | 10秒(長さをフレーム数で指定する必要がある場合は、同等のフレーム数) |
| アスペクト比 | 16:9 横向き |
| シード | 42(モデルがシードパラメーターを公開している場合) |
| プロンプト拡張 | モデル作成者が推奨している場合はオン、それ以外はオフ |
| CFG/ガイダンス | 公式APIのデフォルト値、またはオープンソースリポジトリのデフォルト値 |
| 推論ステップ | 公式APIのデフォルト値、またはオープンソースリポジトリのデフォルト値 |
プロバイダーが厳密なデフォルト値に対応していない場合は、対応する最も近い値を使い、同距離なら大きい方を選びます(例:24 FPSを利用できない場合、18 FPSと30 FPSはどちらもデフォルト値から同じ距離にあるため、30 FPSを優先します)。AA-Video-T2V v2.0とAA-Video-I2V v1.0では音声出力を有効にしてモデルをベンチマークし、それ以外のデフォルト設定はすべて適用します。
テキストから動画生成
テキストから動画生成モデルは、テキストプロンプトのみを入力として受け取ります。プロンプトは、厳選された再現可能なプロンプトセットから抽出します。
画像から動画生成
画像から動画生成モデルは、参照画像と、対応している場合は付随するテキストプロンプトを受け取ります。ベンチマークで使用する参照画像は、次の基準に従います。
- 形式: PNG(可逆圧縮)。非可逆圧縮による圧縮アーティファクトを避けるため、JPG/JPEGは使用しません。
- 解像度: 1920×1080(16:9、目標とする動画解像度と同じ)。
- バイト送信へのフォールバック: プロバイダーがURLを受け付けない場合、または特定のサイズや形式を要求する場合は、画像をダウンロードして必要な変換を施し、バイトデータを直接アップロードします。
- アップロード時間: 生成前の工程としてプロバイダーのプラットフォームへの画像アップロードが必要な場合、そのアップロード時間を生成時間に含めます。
AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0
方法論の概要
テキストから動画を生成するモデルは、ユースケースによって能力が異なります。人物の演技やリップシンクで先行するモデルもあれば、アニメーション、画面上のテキスト、UIモーションで先行するモデルもあります。スタジオがブランドフィルムに選ぶモデルが、プロダクトチームのUIモーションデモやクリエイターのソーシャル向けクリップに最適とは限りません。
私たちの方法論は、この能力の違いを直接測定します。実世界のユースケースとモデル能力からなるタクソノミー全体で人間の選好によりモデルをランク付けし、総合的に最良のモデルと、特定の仕事に最良のモデルを特定します。プロンプトセットを定期的に更新することで、リーダーボードは動き続けるフロンティアを測定し続けます。
AA-Video-T2V v2.0は、音声ありのテキストから動画生成を評価します。AA-Video-T2V-Silent v2.0は、音声なしのテキストから動画生成を評価します。
プロンプトのキュレーションと更新
モデル能力の進化に合わせてフロンティアを追うため、定期的に更新する厳選したプロンプトセットを維持しています。
- プロンプトのタクソノミー:すべてのプロンプトは、実世界のユースケースとモデル能力という2つの軸に沿って作成され、両方のタグが付与されます。各プロンプトには視覚スタイルのタグも付与されます。アリーナではユースケースと能力全体で均等にプロンプトをサンプリングします。
- プロンプトセット:AA-Video-T2V v2.0では1,000件のプロンプトを使用します。AA-Video-T2V-Silent v2.0では500件のプロンプトを使用します。
- 鮮度:プロンプトセットは定期的に更新されます。モデル間を判別できなくなったプロンプトや、今日のユーザーによる動画モデルへのプロンプトの書き方を反映しなくなったプロンプトは引退させます。
プロンプトのタクソノミー
プロンプトのタクソノミーは2つの軸に沿って構築し、視覚スタイルは別途タグ付けします。
ユースケース。これらのユースケースは、消費者と企業がテキストから動画生成をどのように採用しているかの分析と、新興ユースケースの観察に基づいています。各ユースケースのタスク例:
- Marketing & Advertising:アニメーションポスター、ロゴアニメーション、ブランドフィルム、主力商品のスポット広告、ローンチ動画
- Retail & E-commerce:スタジオでの商品撮影、商品デモ、アパレルやファッションの動き、クリエイター風の推薦動画、コーディネートの試着
- Live-Action Film:映画的なショット、ショートドラマのエピソード、プリビジュアライゼーション
- Animation & Gaming:アニメーションシーン、ゲームトレーラー、アニメーションとゲームのプリビジュアライゼーション
- Architecture & Real Estate:外観のフライスルー、内観のウォークスルー、バーチャルステージング
- Productivity & Knowledge Work:解説動画、教育・研修動画、アニメーション付きのデータビジュアライゼーション、シナリオシミュレーション
- UI/UX & Motion Design:キネティックタイポグラフィ、各種デバイスでのUIモーションデモ、抽象的なモーショングラフィックス
- Consumer:自撮り、個人的な瞬間、日常のストック映像やBロール
- Social Media & Creator Content:トーキングヘッド、ポッドキャストのクリップ、ASMRや爽快系動画、ダンス、Vlog、トレンドのフォーマット
- Frontier:現在のフロンティアとその先の能力
能力。これらのモデル能力は、主要モデルラボとの継続的な協働と各ラボが追求する能力を踏まえ、学術ベンチマークに根ざしています。各能力の例:
- Physics:力学、熱の効果、物質間の相互作用、破壊と変形、光学、因果関係、反事実的な物理
- Complex Composition:属性の結び付け、空間関係、複数オブジェクトのインタラクション、カウント、時間的な順序
- Human Anatomy:歩行と移動、微細な動作、表情、アクロバティックな動き、物体の把持、人同士のインタラクション
- Lighting & Materials:ライティング、露出、影、色温度、テクスチャ、布、髪と毛並み
- Multi-Scene & Narrative:複数の出来事からなるストーリー、ショットの切り替え、モンタージュ、ショットをまたいだ同一性の維持
- Camera Control:クローズアップ、空撮、POV、ローアングルなどのショットタイプと、トラッキング、ドリー、オービット、クレーン、クラッシュズーム、ウィップパン、ラックフォーカスなどのカメラワーク
- Text Rendering:短文と長文、2Dレイアウト、非語彙的な文字列、変形する表面上のテキスト
- Spatio-Temporal Consistency:空間的な一貫性、タイムラプス、遮蔽と再登場、ワンショットのストーリー
- Audio Synchronization:ダイジェティックな効果音、BGMと劇伴、画面内外の音
- Dialogue & Lip Sync:単独話者と複数話者のセリフ、ボイスオーバーと画面上の発話
スタイル。各プロンプトには、Photorealistic、3D Render/CGI、Cartoon and Anime、Flat Design、Hand-drawn/Illustration、Stop-Motion/Claymation、Lo-Fi、Mixed Stylesの8つの視覚スタイルのいずれかのタグも付与されます。スタイルは均等にはサンプリングされず、大半のプロンプトはフォトリアルです。
プロンプトの作成
フロンティアの動画モデルは単純なリクエストを問題なくこなすため、プロンプトはこれらのモデル間の差が出るように作成しています。プロンプトは次の方針で書かれます:
- タクソノミーを完全にカバーするため、すべてのユースケースと能力の組み合わせに均等に配分し、各能力で複雑さの下限を高く設定します。たとえば、微妙な動きではなく大きな動きや、相互に作用する複数の被写体です。
- 実際の制作業務を反映するため、モデル開発者のプロンプトガイド、既存のプロンプトセット、業界全体で見られるワークフローを参考にします。
- 音声を考慮してAA-Video-T2V v2.0向けに作成します。シーンに必要な場合は、セリフ、効果音、環境音、音楽をプロンプトで指定します。
すべてのプロンプトは、アリーナで提供する前に人手でレビューします。
プロンプトの引退
アリーナの投票でモデル間を判別できなくなったことが示されたプロンプトや、ユーザーによる動画モデルへのプロンプトの書き方を反映しなくなったプロンプトは引退させます。
サンプリング手法
各マッチアップでは、ユースケースと能力の組み合わせ全体で均等にサンプリングし、選ばれた組み合わせの中からランダムにプロンプトを抽出します。
各マッチアップは、同じプロンプトから同一ベンチマーク内で生成された2本の動画を組み合わせるため、音声付きの動画が無音の動画と組み合わされることはありません。左右の位置はランダム化されます。
再生基準
すべての動画は、次の同じ基準で評価者に提供します:
- 解像度:生成されたままの解像度で、最大1080p。動画をアップスケールすることはありません。1080pを生成できないモデルは対応する最高解像度で提供し、1080pを超える出力は1080pにダウンスケールします。
- エンコード:高画質のH.264で、ビットレートのピークを10 Mbpsに制限します。
- 長さ:16:9で10秒。10秒を生成できないモデルは、対応する最大の長さで提供します。
- 音量の平準化:AA-Video-T2V v2.0では、各動画のラウドネスを単一の固定ゲインで-18 LUFSに近づけます。モデルのミックスにコンプレッションやリマスターを施すことはなく、音量の大きさで勝つモデルはありません。
Eloの算出
投票の収集
モデルの品質は人間の選好で測定します。
- ブラインド一対比較投票:評価者は、同じプロンプトから2つの異なるモデルが生成した2本の動画を、モデルの正体を知らされずに視聴し、好ましい方を選びます。両方の動画は1つのプレーヤーでフルサイズで再生され、評価者は2本を切り替えて比較します。
- 判定ヒント:各マッチアップには、プロンプトのユースケース、主要能力、スタイルに紐づく短いヒントが表示され、検証対象の具体的な観点に注意を向けさせます。
- エンゲージメントゲート:投票は、各動画が8秒以上再生された後にのみ可能です。AA-Video-T2V v2.0では、評価者にヘッドホンを使用して音声も評価するよう求めます。
- 投票品質:両リーダーボードとも、当社が募集したパネルの投票のみでランク付けされます。パネルの参加者はパネル提供元が審査と本人確認を行っています。各セッションのマッチアップの約5分の1は、強いコンセンサスのある正解を持つ品質チェックです。これらのチェックに不合格となったセッションは却下され、その投票はすべて削除されます。品質チェックの投票はレーティングに算入されません。
投票のフィルタリング
AA-Video-T2V v2.0とAA-Video-T2V-Silent v2.0は新しいリーダーボードです。今回の更新より前に投じられたテキストから動画生成の投票は、以前のプロンプトと再生基準の下で収集されたものであるため、すべてのモデルについて除外します。Video Arenaの一般投票はこれらのレーティングに算入されません。Eloは保持された投票に対してゼロから算出し、総合リーダーボードとすべてのサブカテゴリーのリーダーボードでKling 3.0 1080p (Pro) = 1000にアンカーしています。
リーダーボード
各ベンチマークについて、次のリーダーボードを公開しています:
- 総合リーダーボード:保持されたすべての投票に基づく順位です。モデルは最低限の投票数に達すると掲載されます。
- カテゴリー別リーダーボード:同じ計算を、特定のユースケース、能力、スタイルのタグが付いたプロンプトに限定したもので、カテゴリーの投票数が十分に集まった時点で公開します。
生成時間のテスト方法
主な技術的詳細:
- 実行頻度: テキストから動画生成を2時間ごとに、各時間枠内で無作為にずらした時刻に実行します。
- サンプルサイズ: 主要指標として示す生成時間は、直近3日間に成功した測定値の中央値です。2時間ごとに測定するため、テキストから動画生成では通常、1つの期間につきホストごとに約36サンプルが蓄積されます。
- プロンプトの選択: 実行ごとに、厳選されたデータベースのプールから1つのプロンプトを無作為に抽出し、有効なすべてのホストモデルへ送信します。
- シード: モデルがシードパラメーターを公開している場合は、実行間で出力を再現できるよう、固定シード42を使用します。
- エンドツーエンドの計測: 生成時間は、最初のAPI呼び出しから完成した動画のダウンロードまでをエンドツーエンドで測定します。非同期API(送信、ポーリング、ダウンロード)を使うプロバイダーでは、キュー待機、推論、ダウンロードを含みます。
- APIモード: 測定するキュー待機時間にポーリング間隔ではなくプロバイダーの実時間が反映されるよう、100ミリ秒ごとにジョブの状態をポーリングします。
- 対象範囲: 現在、生成時間は無音のテキストから動画生成モデルと画像から動画生成モデルについてのみ測定しています。AA-Video-Editing-Silent v1.0と3つの音声付きベンチマーク(AA-Video-T2V v2.0、AA-Video-I2V v1.0、AA-Video-Editing v1.0)はVideo Arena(品質Elo)で順位付けしていますが、現時点では遅延のベンチマークを行っていません。
- 集計: 外れ値を除外せず、成功した測定値の未加工の分布から中央値、p05、p25、p75、p95を計算します。
- 測定しない項目: プロバイダーのコールドスタート遅延、認証ハンドシェイク、再試行のオーバーヘッド、クライアントのウォームアップは測定しません。データセットの各エントリは、単発の測定1回分です。
- インフラストラクチャ: us-central1のGoogle Cloud Runで実行します。
- 新規エンドポイント: 一般公開前にベンチマークしたものを含む新規エンドポイントでは、結果を掲載する前に生成時間の分布を構築するため、ベンチマークの実行頻度を調整する場合があります。公開結果は直近3日間の測定値から算出するため、新たに掲載したエンドポイントの数値には初期の実行結果が反映され、その後の測定値が蓄積するにつれて変化する可能性があります。
モデルとプロバイダーの掲載基準
当社の目的は、人気が高く高性能な動画生成モデルを分析・比較し、ユーザーの選択を支援することです。そのため、業界での重要性と競争力のある性能を検証し、新しいモデルやプロバイダーを掲載するか評価します。これらの基準は継続的に改善しており、ご意見やご提案を歓迎します。モデルやプロバイダーを提案するには、お問い合わせページからご連絡ください。
独立性に関する声明
ベンチマークは、厳格な独立性と客観性のもとで実施します。Artificial Analysisへの掲載または有利な結果の対価として、プロバイダーから報酬を受け取ることはありません。