画像生成ベンチマークの方法論

対象範囲と背景

Artificial Analysisでは、通常サーバーレスAPIエンドポイントを通じて提供される画像生成モデルをベンチマークしています。このページでは、画像生成モデルの品質、速度、料金を測定する方法を説明します。

画像生成機能については、次の2つのモダリティを扱います。

  • テキストから画像:テキストプロンプトのみから画像を生成するモデル。
  • 画像編集:テキストプロンプトに基づいて参照画像を変更するモデル。

エンドポイントの対象範囲

対象ワークロード:推論ベンチマークは、テキストから画像を生成するエンドポイントを対象とします。

公開サーバーレスエンドポイントのみ:ベンチマークは、現在または今後一般公開される真のサーバーレスエンドポイントを対象とします。デモ製品、ハードウェアのショーケース、専用または非公開のデプロイは対象外です。

Standard/Modifiedエンドポイント

各エンドポイントを、ネイティブモデルを完全な忠実度で提供し、標準の入力パラメーターを公開するStandard(標準)、または通常は生成速度の向上やコスト削減を目的に、出力の忠実度へ影響する形でネイティブモデルから変更されたModified(変更済み)のいずれかに分類します。

ModifiedエンドポイントにはArtificial Analysis上で「Modified」と表示し、デフォルトのリーダーボード表示では非表示にする場合があります。表示を選択したユーザーは引き続き確認できます。デフォルトベンチマークの公平性を保つため、蒸留、ネイティブモデルの入力パラメーターの一部のみの公開、出力品質の著しい低下などを指標として、エンドポイントをModifiedに分類するかどうか、および同一モデルのバリエーションをいくつ掲載するかは、当社の裁量で決定します。

デフォルトの生成設定

各モデルが公開しているデフォルト設定を使用して画像を生成します。ファーストパーティAPIではAPIドキュメントに記載されたデフォルト、オープンソースモデルではオープンソースリポジトリのデフォルトを使用します。これには、推論ステップ数、ガイダンススケール、デフォルトのネガティブプロンプトの動作が含まれます。モデル間を公平に比較できるよう、次の正規化を適用します。

  • 各モデルが対応する最高解像度で生成し、アリーナで提供する際に1024×1024へ縮小します。
  • プロンプトごとに1枚の画像を生成します。
  • アスペクト比は1:1を使用します。
  • シードは42を使用します。

画像編集モデルでは、各プロンプトに厳選したセットの参照画像を組み合わせます。

主要指標

画像生成モデルの品質、性能、料金を追跡するために、次の指標を使用します。

品質Elo

各モデルのEloスコアは、Image Arenaでのユーザー投票から算出した相対的な品質を示します。レーティングはBradley-Terry最尤推定法で計算し、読みやすいようEloに似た範囲へ再スケーリングしています。

アリーナでは同じモダリティの出力同士だけを組み合わせるため、各モダリティを個別に採点します。

1,000枚あたりの料金

プロバイダーが設定する生成画像1枚あたりの料金(USD)を1,000倍したものです。

各プロバイダーが公開している画像1枚あたりの料金をそのまま使用します。

生成時間

プロバイダーが1枚の画像を生成するのに要した時間の中央値です。過去14日間の測定値から算出します。

画像はバッチサイズ1で生成します。画像レスポンスではなくURLが提供される場合、生成時間にはプロバイダーから画像をダウンロードする時間も含まれます。URLは生成の完了前に発行される可能性があるため、エンドユーザーの遅延を反映するためです。

Text to Image

方法論の概要

テキストから画像を生成するモデルは、幅広いユースケースにわたって能力が異なります。テキスト描画で先行するモデルもあれば、複雑なレイアウトやフォトリアルな人物表現で先行するモデルもあります。広告代理店がキャンペーンのクリエイティブに使うモデルが、プロダクトマネージャーの UI モックアップやゲームスタジオのコンセプトアートに最適とは限りません。

私たちの方法論は、この能力の違いを直接測定します。実世界のユースケースとモデル能力からなる構造化されたタクソノミー全体で人間の選好によりモデルをランク付けし、総合的に最良のモデルと、特定の仕事に最良のモデルを特定します。タクソノミーは分野の進む先を見据えており、主要ラボが積極的に追求する能力と、画像生成が実際に普及しつつあるユースケースを網羅します。プロンプトセットは毎月更新され、リーダーボードは動き続けるフロンティアを測定し続けます。

プロンプトのキュレーションと更新

急速に進化するモデル能力のフロンティアに留まり、リーダーボードの公平性と正確性を保つため、定期的に更新されるプロンプトのローテーションを維持しています。

  • プロンプトのタクソノミー:すべてのプロンプトは、実世界のユースケースとモデル能力という 2 軸のタクソノミーに沿って作成され、両方のタグが付与されます。アリーナではタクソノミー全体で均等にプロンプトをサンプリングします。
  • 実ユーザーデータ:プロンプトはエンドユーザーの実際のプロンプトの書き方を反映するように作成され、匿名化されたクラウドソーシングデータと、人手でキュレーションされ継続的に更新されるプロンプトコーパスを参考にしています。
  • 鮮度:プロンプトセットは毎月更新されます。モデル間をどれだけ判別できるか、今日の実ユーザーの画像モデルへのプロンプトの書き方をどれだけ反映しているかに基づいて、プロンプトを引退させます。

私たちのプロンプトセットは、実ユーザーデータのシグナルを保ちながら、ユースケースと能力全体に偏りのない均等なカバレッジを提供します。

プロンプトのタクソノミー

プロンプトのタクソノミーは 2 つの軸に沿って構築します。

ユースケース。消費者と企業がテキスト画像生成をどのように採用しているかの分析と、新興ユースケースの観察に基づいています。各ユースケースの例:

  • Marketing & Advertising:広告クリエイティブ、キャンペーンビジュアル、ポスター、ブランドイメージ
  • Retail & E-commerce:商品写真、モデル着用アパレル、パッケージモックアップ
  • Live-Action Film:映画的シーン、フィルムスチル、絵コンテ、キャラクターシート
  • Animation & Gaming:ゲームアセット、コンセプトアート、キャラクターデザイン、コミック
  • Architecture & Real Estate:内外装ビジュアライゼーション、間取り図、ステージング
  • Productivity & Knowledge Work:ダイアグラム、インフォグラフィック、チャート、スライド
  • UI/UX Design:アプリ・ウェブ・車載・空間サーフェスの UI モックアップ
  • Consumer:本の表紙、ストック画像、エディトリアルイラスト
  • Social Media & Creator Content:サムネイル、プロモカード、チャンネル・プロフィールアート
  • Frontier:現在のフロンティアとその先の能力

能力。主要モデルラボとの継続的な協働と各ラボが追求する能力に基づき、学術ベンチマークに根ざしています。各能力の例:

  • Reasoning:エンティティ・数学・空間・論理の推論、概念の組み合わせ、慣用句の解釈
  • Knowledge:実在のランドマークや生物種、科学と常識にわたる領域知識
  • Text Rendering:長文、小さな文字、記号、装飾的なレタリング
  • Layout:フロー、矢印、ブロック、視覚的ヒエラルキー、複数パネル構成
  • Complex Compositions:正確なカウント、空間関係、被写体のインタラクション、属性の結び付け
  • Lighting:反射、屈折、影、コースティクス
  • Material:表面特性、透明度、サブサーフェススキャタリング、テクスチャのリアリズム
  • Physics:重力、支持、衝突、熱・状態変化
  • Human Anatomy:手、顔、身体のプロポーション、動的なポーズと動き

プロンプトの作成

プロンプトは厳格な作成基準に従います。平易な自然言語、ネガティブプロンプト欄を空にした単一のポジティブプロンプト、特定のモデルファミリーを優遇しないアーキテクチャ中立な表現です。作成時に冗長性を検査し、多様な実利用シナリオをカバーするようにしています。プロンプトは次の方針で書かれます:

  • タクソノミーを完全にカバーするため、すべてのユースケースと能力の組み合わせに均等に配分します。各プロンプトがユースケース・能力・スタイルのタグを持つため、モデルの総合品質だけでなく、ユーザーごとに重要な具体的な切り口での性能も評価できます。複雑なレイアウト階層を持つ UI デザインに最適なモデルが必要な人もいれば、リアルな人物を収めた見事なシネマティックショットが必要な人もいます。
  • エンドユーザーの実際のプロンプトの書き方を反映するため、実ユーザーからクラウドソーシングした匿名化プロンプトと、人手でキュレーションされライブ更新される消費者プロンプトパターンのコーパスを参考にします。

すべてのプロンプトは:

  • 英語で作成
  • 人手でキュレーション

その結果、シグナルが高くノイズの少ないプロンプトセットが得られ、今日そして近い将来にエンドユーザーと産業に最も関わりの深い生成タスクでモデルを評価できます。

プロンプトの引退

毎月、次の 2 つの基準で引退させるプロンプトを選定します:

  • 判別力:各プロンプトがモデルの能力差について依然として明確なシグナルを生むかどうか。各投票について、(グローバルリーダーボード基準で)上位のモデルを本命とラベル付けします。本命の勝率が統計的に偶然と区別できないプロンプトは引退候補としてフラグされます。
  • 鮮度/リアリズム:ベンチマークのプロンプトセットを、私たちの最新のクラウドソーシングプロンプトや人手キュレーションのプロンプトコーパスを含むライブプロンプトコーパスと比較し、現実のプロンプト慣習をもはや反映しないプロンプトを除外します。

引退したプロンプトは、アリーナでの投票収集には提供されなくなります。毎月の更新サイクルはリーダーボードの完全性も守ります。ローテーションするプロンプトセットに過適合することはできません。

サンプリング手法

プロンプトセットの各プロンプトには、ユースケースタグ 1 つと主要能力タグ 1 つが付与されます。すべてのユースケースと能力の組み合わせで均等にサンプリングします。

各マッチアップは、同一のプロンプトから同一モダリティ内で生成された 2 つの出力を組み合わせます。左右の位置はランダム化され、モデルの正体は投票後にのみ明かされます。新規追加モデルはレーティングが収束するまで一時的に多めにサンプリングされ、対戦相手は各マッチアップの情報価値を最大化するように選ばれます。各ユースケースと能力は、リーダーボード全体のレーティングに等しい重みで寄与します。

Elo の算出

投票の収集

モデルの品質は人間の選好で測定します。

  • ブラインド一対比較投票:評価者は、同じプロンプトから 2 つの異なるモデルが生成した 2 つの出力を、モデルの正体を知らされずに見て、好ましい方を選びます。
  • 判定ヒント:各マッチアップには、プロンプトのユースケース・能力・スタイルのタグに紐づく短いヒントが表示され、複雑なプロンプトで検証対象の観点に注意を向けさせます。
  • エンゲージメントゲート:投票は各出力と最低限のエンゲージメント時間を経た後にのみ可能です。
  • 投票品質:すべての投票はレーティング計算に入る前にボット検出と異常フィルタリングを通過します。

投票のフィルタリング

現在の方法論が測定する対象に合わせて投票をフィルタリングします。現行方法論より前の投票は、前世代のモデルを区別するために書かれたプロンプトに投じられたものです。現行モデルはそうしたプロンプトの多くを飽和させており、ほぼすべてのモデルが許容可能な結果を出すため、そこでの投票は能力差ではなくコイントスを記録することになります。そこで、過去の投票にはコホートベースのフィルターを適用します:

  • 現行コホート:一般公開されており、リリースが新しく、読者にとって最も関わりの深いモデル。現行方法論の下で収集された投票のみでランク付けされます。
  • レガシーコホート:それ以外のすべてのモデル。登場したすべての投票でランク付けされ、リーダーボード上での存在は保たれます。
  • ルール:投票は、参加した両モデルがその投票の対象として適格である場合に限り保持されます。

このフィルターは、ボットやスパムの除外を含む標準的な投票品質フィルターの後に適用されます。Elo は保持された投票セット全体に対してゼロから再計算され、現行・レガシーを問わずすべてのモデルがその単一の計算でランク付けされます。レーティングは、総合リーダーボードでは FLUX.1 [schnell] = 1000 に、すべてのサブカテゴリーのリーダーボードでは FLUX.2 [dev] = 1000 にアンカーされています。

生成時間のテスト方法

主な技術的詳細:

  • 実施頻度:ベンチマークは毎日ランダムな時刻に4回実行します。
  • サンプルサイズ:主要指標の生成時間は、直近14日間の成功した測定値の中央値です。通常、各期間においてホストモデルごとに約56サンプルとなります。
  • 計測対象:各測定では、1枚の画像に対するリクエストのライフサイクル全体を計測します。APIリクエスト、プロバイダーでの推論、インラインのレスポンス本文またはURLからディスクへのダウンロードが含まれます。プロバイダーがURLを返す場合、画像の書き込みが完了する前にURLが発行されることが多いため、実際のエンドユーザーの遅延を反映するためバイト列のダウンロードも計測します。
  • 固有のプロンプト:厳選したプールから呼び出しごとに新しいプロンプトを生成し、プロバイダーが実行間でキャッシュ済みのレスポンスを返せないようにします。
  • 解像度:1024×1024で生成します。モデルが対応する最小解像度が1024×1024より高い場合は、1024×1024に最も近い対応解像度のうち最小のものを使用します。
  • APIモード:利用可能な場合は、プロバイダーの同期エンドポイントを使用します。非同期のみのプロバイダーでは100ミリ秒ごとにジョブの状態をポーリングし、測定するキュー待機時間にポーリング間隔ではなく、プロバイダーで実際に要した時間を反映します。
  • 集計:外れ値を除外せず、成功した測定値の生の分布から中央値、p05、p25、p75、p95を計算します。
  • 無効にするプロバイダー機能:APIで対応している場合、透かしと安全性チェックを無効にし、生成速度に関係のない遅延変動の要因を取り除きます。
  • 計測対象外:プロバイダーのコールドスタート遅延、認証ハンドシェイク、再試行のオーバーヘッド、クライアントのウォームアップは計測しません。データセットの各項目は、単発の測定1回分です。
  • インフラストラクチャ:Google Cloudのus-central1で実行します。
  • 新しいエンドポイント:一般公開前にベンチマークしたものを含む新規追加エンドポイントでは、結果を掲載する前に生成時間の分布を構築するため、ベンチマークの頻度を調整する場合があります。公開結果は直近14日間の測定値から計算するため、新たに掲載したエンドポイントの数値には初期の実行結果が反映され、測定値が蓄積するにつれて変化する可能性があります。

モデルとプロバイダーの掲載基準

当社は、人気があり高性能な画像生成モデルを分析・比較し、ユーザーの選択に役立てることを目指しています。そのため、業界での重要性と競争力を検証し、新しいモデルやプロバイダーの掲載可否を評価します。基準は継続的に改善しており、ご意見やご提案を歓迎します。モデルやプロバイダーを提案するには、お問い合わせページからご連絡ください。

独立性に関する声明

ベンチマークは、厳格な独立性と客観性をもって実施しています。Artificial Analysisへの掲載や好意的な結果の見返りとして、プロバイダーから報酬を受け取ることはありません。