音声合成ベンチマークの方法論
対象範囲と背景
Artificial Analysisでは、主にサーバーレスAPIエンドポイントを通じて提供される音声合成モデルをベンチマークしています。このページでは、品質と性能の両方を含む音声合成ベンチマークの方法を説明します。速度と価格の指標にはサーバーレスエンドポイントが必要です。これを持たないモデルも、品質比較のみを目的としてアリーナに含める場合があります。
性能ベンチマークとアリーナのいずれでも、サーバーレスAPIを利用するエンドユーザーの体験を反映することに重点を置いています。各プロバイダーのドキュメントで推奨される標準的なAPI実装を使用します。
主要指標
音声合成モデルの品質、性能、料金を追跡するために、次の指標を使用します。
品質Elo
Artificial Analysis Text to Speech Arenaでのユーザーの回答から決定した、モデルの相対的なEloスコアです。ランキングは、ペア比較の投票から最尤法で推定したBradley-Terryモデルにより算出します。レーティングは、アリーナごとに1つのモデルを1000に固定して基準とし、他のスコアは標準的なEloスケール上でそれに対する相対値として表示します。比較の提示方法と投票の仕組みについては、下記のアリーナの仕組みを参照してください。
対戦のサンプリングでは、新たに加わったモデルやまだレーティングのないモデルなど、比較を必要とするモデルを優先します。これにより、新しいモデルも比較を早く蓄積できます。また、あるモデルの比較のうち単一の対戦相手が占める割合には上限を設け、推定時には、繰り返し頻度の高い組み合わせの対戦の重みを下げて、単一の組み合わせがモデルのレーティングを左右しないようにしています。当社の検証では、プロバイダー音声アリーナと統制音声アリーナのいずれでも、ランキングはこの重み付けの強さに対して頑健でした。
各ボードはそれぞれ独立に推定します。総合レーティングは対象となるすべての投票を用いる一方、カテゴリー別・アクセント別・言語別のボードは、総合結果を集計したものではなく、それぞれの部分集合に対する個別の推定です。ボードの履歴に含まれる対象投票はすべて同じ重みで扱われ、時間による重み付けや古い投票の減衰は行いません。レーティングは全投票履歴をもとに1日に複数回再計算し、公開前に確認しています。95%信頼区間と順位範囲を表示し、モデルは丸める前のEloの順に並べています。まだ十分な投票が集まっていないため、一部のモデルが表示されない場合があります。
Pronunciation Robustness
Pronunciation Robustness ベンチマークは、Text to Speech モデルが難しいテキストを正しく発音できるかを測定します。固定されたチャレンジ文セットの発音で各モデルを採点し、人間のレビュアーが許容される読み方に基づいて判定することで、Arena の選好結果を補完します。
すべてのモデルが、固定された単一の米国英語ボイスで同一のセットを読み上げます。各文には、米国英語と英国英語で有効なバリアントを含む許容発音が定義されたハイライト箇所が 1 つ以上含まれます。クリップはモデル名を伏せてランダムな順序でレビュアーに提示されます。プロンプトは当社側で正規化を行わず、記述されたとおりに各モデルへ送信されます。モデルにテキスト正規化の設定がある場合は、そのデフォルト値を使用します。
このセットは 4 つの発音チャレンジのカテゴリーを網羅しています:
- Contextually Appropriate (Contextual Disambiguation): 綴りが同じでも文脈によって読み方が変わる単語。例: a wound that is bandaged と a bandage that is wound。
- Expanding Shorthand (Text Normalization): 数字、日付、単位、記法を自然に読み上げる。例: 6'2"、Chapter XVII、1 tsp of sugar。
- Preserving Exact Sequences (Sequence Fidelity): コード、パス、メールアドレス、識別子を正確に読み上げる。例: .env.local や a.chen@ucsf.edu。
- Standalone Terms (Term Pronunciation): ブランド名、地名、専門用語を正しく発音する。例: Arkansas、façade、genre。
公開対象の各モデルでは、クリップの 95% 以上を 3 名以上の第三者レビュアーが判定します。ハイライト箇所ごとに、自然かつ正しく発音されたかを「はい」「いいえ」「判別できなかった」のいずれかで回答します。モデルのスコアは、はい と いいえ の合計に対する はい の割合です。「判別できなかった」の回答は分母から除外されます。カテゴリー別スコアも同じ式をそのカテゴリーの箇所に適用します。エラーバーは 95% 信頼区間を示し、各箇所を複数のレビュアーが判定するため、箇所単位でクラスター化した標準誤差で算出しています。
セット内サンプルの少なくとも 95% が 3 名以上の承認済みレビュアーによってカバーされた時点で、そのモデルの結果を公開します。
レビュアーに表示される評価カードの例と、ベンチマーク掲載の全モデルのサンプルクリップは、Pronunciation Robustness の概要をご覧ください。
100万文字あたりの料金
すべてのTTSモデルについて、入力テキスト100万文字あたりの料金を示します。プロバイダーが文字単位で直接料金を設定していない場合は、次の方法で相当額を算出します。
- 文字単位:掲載されている料金をそのまま使用
- サブスクリプションプラン:100万文字以上を含む最も安価なプラン(利用可能な場合は年額プラン)について、利用率80%を前提に実効料金を算出
- トークン単位:バッチ料金を使用し、文字数を入力トークンに換算して音声出力の長さを推定
- 出力時間:1分あたり150語、約825文字の発話速度を想定して換算
- バイト単位:英語テキストでは、1 UTF-8バイトを約1文字として換算
- 推論時間:約500文字のテキスト約25件を使用したベンチマーク実行から推定
- オープンウェイト:料金を記載せずに掲載。ただし、有料APIでも提供されている場合は、その料金を使用
- 音声対話モデル:20件の固定TTSアリーナプロンプトで音声を生成する費用から算出。報告されたテキスト入力、音声出力、テキスト出力、および個別に公開された推論/思考トークンを基にします。音声レスポンスの一部として出力テキストトークンが報告される場合は、それらも含めます。プロンプトはそれぞれ独立したシングルターンのリクエストとして実行され、料金への影響が無視できるため、キャッシュ効果は除外します。
スループット
プロバイダーが1秒あたりに音声へ変換する入力テキストの文字数の中央値で、過去3日間の測定値から算出します。生成ごとに、プロンプトの文字数を、クリップの生成と受信に要した時間で割って求めます。
この測定には、音声データではなくURLが返される場合のダウンロード時間も含めています。URLは音声の生成完了前に発行されることがあるため、生成された音声クリップをエンドユーザーが実際に受け取るまでの体験を反映するためです。該当する場合、音声クリップはバッチサイズ1で生成します。
ベンチマークは1日に4回実施します。各ベンチマーク評価では、モデルごとに1つの音声をランダムに選択します。生成ごとに約500文字の固有のプロンプトを使用します。
アリーナの仕組み
各比較では、同じテキストプロンプトから生成した2つの音声クリップを提示します。プロバイダー音声アリーナでは、両方のクリップに同じ性別・アクセントのカテゴリーの音声を使用し、統制音声アリーナでは、両方に同じクローン参照音声を使用します。モデル名は投票後まで伏せられ、提示順はランダム化されます。また、各クリップを一定以上再生しないと投票できません。投票は引き分けのない二者択一です。プロンプトは4つのカテゴリー(カスタマーサービス、エンターテインメント、知識共有、アシスタント)にわたり、英数字の並びや数字の列といった難易度の高い素材も含みます。プロンプトのセットは随時更新しています。
音声サンプルはモデルごとに一度だけ生成し、標準化したうえでアリーナに投入します。そのため、あるモデルへの投票は、公開前に確認と正規化を行った一貫したサンプルセットに対して行われます。クリップは共通の再生フォーマットに変換し、共通のラウドネス目標に正規化しているため、プロバイダー間の音量やエンコードの違いが投票に影響することはありません。
統制音声アリーナ
統制音声アリーナでは、各音声合成モデルの評価に使用する音声を標準化するため、音声クローニングを使用します。同じ参照音声を使ってモデルを比較することで、特定の声に対する聞き手の好みと、発話の自然さ、音質、発音、話すペース、韻律といったモデル品質のより広い側面を切り分けます。これにより、基盤となる音声合成モデルをより同条件で比較できます。
統制音声アリーナの英語参照セットは、プロが録音した8種類の音声(米国英語の女性2名と男性2名、英国英語の女性2名と男性2名)で構成されます。モデルが参照録音全体を受け付ける場合は、モデル側で自動的に切り取る場合も含め、録音全体を提供します。モデルが参照音声の長さを制限している場合は、通常5~10秒または10~15秒の短いバージョンを、自然な間で区切って提供します。
統制音声アリーナでは、英語に加えて、スペイン語、フランス語、ドイツ語、ポルトガル語、日本語、ヒンディー語、標準中国語、アラビア語、ベトナム語でもモデルを評価します。英語以外の各言語では、ネイティブスピーカーが専門的な環境で録音した男性音声1種類と女性音声1種類を参照セットに使用します。各言語内でも音声クローニングによって音声を標準化し、選好投票は、評価対象の言語が第一言語であることを条件に選定された評価者から収集します。各モデルは対応している言語でのみ評価され、モデルが安定したEloレーティングを算出するのに十分な比較数を蓄積した時点で、言語別のリーダーボードが公開されます。
統制音声アリーナは、各モデルをそのモデル独自の公開音声の代表的なセットで評価するプロバイダー音声アリーナを補完します。
以下から統制音声を選択すると、その参照録音を試聴できます。
プロバイダー音声アリーナ
プロバイダー音声アリーナでは、各音声合成モデルを、そのモデルのプロバイダーが提供する音声の代表的なセットで評価します。これは、同じクローン参照音声でモデルを比較する統制音声アリーナを補完するものです。プロバイダー音声は、各モデルが独自の公開API、製品インターフェース、ドキュメントを通じてユーザーに通常どのように体験されるかを反映します。
モデル間の比較が代表的かつ公平になるよう、各モデルについてプロバイダーが提供する複数の音声を選択します。男性と女性、米国英語と英国英語の各組み合わせから2音声ずつ、合計8音声を選びます。性別とアクセントの組み合わせが利用できない場合、その組み合わせはプロバイダー音声アリーナの評価から除外します。
音声はプロバイダーのインターフェースやドキュメントでの目立ちやすさを基準に選び、強く様式化された地域アクセントなど、中立的でない音声は除外します。多数の音声が利用できる場合は、モデル開発元が特定の音声の使用を依頼することもできます。通常オープンソースモデルに見られるように、プロバイダー音声が提供されない場合は、プロの声優による音声クリップを音声生成のソースファイルとして使用します(サンプルは上記の「統制音声アリーナ」を参照)。
以下からモデル開発元を選択すると、その開発元の各モデルで現在使用しているプロバイダー音声を確認できます。
投票者の品質
当社が公開する評価の大半は、同種の案件で良好な実績を持つ有償パネルによるもので、アリーナの選好投票と Pronunciation Robustness の判定の双方を対象としています。英語のアリーナおよび Pronunciation Robustness では、米国または英国に居住する英語ネイティブをパネルとして選定します。統制音声アリーナの英語以外の各言語では、第一言語を基準に選定し、可能な限り出身国に居住する評価者を対象とすることで、評価対象の言語のネイティブ話者が評価を行うようにしています。
Pronunciation Robustness のセッションには正解が既知のアテンションチェック用クリップが含まれ、回答したチェックを 1 つでも外したレビュアーは完全に除外されます。アリーナの投票は、ランキングに反映される前に自動の品質スクリーニングを通過します。有償の評価者にモデル名が表示されることはありません。さらに、有償と一般の両プールから得られるランキングを継続的に比較し、整合性を確認しています。
モデルとプロバイダーの掲載基準
当社は、人気があり高性能な音声合成モデルとプロバイダーを分析・比較し、エンドユーザーの選択に役立てることを目指しています。そのため、「業界での重要性」と競争力を検証し、新しいモデルやプロバイダーの掲載可否を評価します。現在も基準を改善しており、ご意見やご提案を歓迎します。モデルやプロバイダーを提案するには、お問い合わせページからご連絡ください。プロバイダーがモデルの重要なアップデートを公開した場合は、日付付きの新しいバリアントとして掲載し、アリーナ用サンプルをすべて生成し直したうえで、投票を引き継がずにランク付けします。以前のバリアントも、掲載要件を満たす限り引き続き掲載します。
独立性に関する声明
ベンチマークは、厳格な独立性と客観性をもって実施しています。Artificial Analysisへの掲載や好意的な結果の見返りとして、プロバイダーから報酬を受け取ることはありません。