Methodik für das Text-to-Speech-Benchmarking

Umfang und Hintergrund

Artificial Analysis führt Benchmarks für Text-to-Speech-Modelle durch, vorwiegend für solche, die über serverlose API-Endpunkte angeboten werden. Diese Seite beschreibt unsere Methodik für das Text-to-Speech-Benchmarking einschließlich der Qualitäts- und Leistungsbenchmarks. Für Geschwindigkeits- und Preiskennzahlen ist ein serverloser Endpunkt erforderlich. Modelle ohne einen solchen können dennoch ausschließlich zum Qualitätsvergleich in die Arenen aufgenommen werden.

Sowohl beim Leistungsbenchmarking als auch in den Arenen geht es uns darum, die Erfahrung von Endnutzern der serverlosen APIs abzubilden. Wir verwenden die Standardimplementierung der Anbieter-APIs gemäß der jeweiligen Anbieterdokumentation.

Wichtige Metriken

Mit den folgenden Metriken erfassen wir Qualität, Leistung und Preis von Text-to-Speech-Modellen.

Qualitäts-Elo

Relativer Elo-Wert der Modelle, ermittelt anhand der Nutzerstimmen in der Artificial Analysis Text to Speech Arena. Die Rangfolge wird aus paarweisen Stimmen mit einem per Maximum-Likelihood geschätzten Bradley-Terry-Modell berechnet. Die Skala wird verankert, indem je Arena ein Modell auf 1000 festgelegt wird; alle weiteren Werte werden relativ dazu auf der üblichen Elo-Skala angegeben. Weitere Einzelheiten dazu, wie Vergleiche dargestellt und bewertet werden, finden Sie unten unter So funktioniert die Arena.

Beim Sampling der Paarungen werden Modelle bevorzugt, die Vergleiche benötigen, etwa neu aufgenommene Modelle und solche ohne Bewertung, sodass neue Modelle rasch Vergleiche sammeln. Eine Obergrenze beschränkt den Anteil der Vergleiche eines Modells, der auf einen einzelnen Gegner entfallen kann, und bei der Schätzung werden Duelle aus häufig wiederholten Paarungen geringer gewichtet, sodass keine einzelne Paarung die Bewertung eines Modells dominiert. In unseren Experimenten reagierte die Rangfolge sowohl in der Provider Voice Arena als auch in der Controlled Voice Arena nicht empfindlich auf die Stärke dieser Gewichtung.

Jede Rangliste wird eigenständig geschätzt: Die Gesamtbewertung nutzt alle zulässigen Stimmen, während Ranglisten nach Kategorie, Akzent und Sprache eigene Schätzungen auf ihren jeweiligen Teilmengen sind und nicht aus dem Gesamtergebnis abgeleitet werden. Alle zulässigen Stimmen in der Historie einer Rangliste zählen gleich; es gibt keine zeitliche Gewichtung und keinen Aktualitätsabschlag. Die Bewertungen werden mehrmals täglich aus der vollständigen Abstimmungshistorie neu berechnet und vor der Veröffentlichung geprüft. Wir zeigen 95-%-Konfidenzintervalle und Rangbereiche an; die Modelle sind nach ungerundetem Elo sortiert. Manche Modelle werden möglicherweise noch nicht angezeigt, weil sie nicht genügend Stimmen erhalten haben.

Pronunciation Robustness

Der Pronunciation-Robustness-Benchmark misst, ob Text-to-Speech-Modelle schwierigen Text korrekt aussprechen. Er ergänzt die Arena-Präferenzergebnisse, indem jedes Modell bei der Aussprache eines festen Satzes von Challenge-Sätzen bewertet wird, beurteilt von menschlichen Prüfern anhand akzeptierter Lesarten.

Jedes Modell liest den identischen Satz mit einer einzigen festgelegten US-englischen Stimme. Jeder Satz enthält eine oder mehrere hervorgehobene Passagen mit akzeptierten Aussprachen, einschließlich der in US- und UK-Englisch gültigen Varianten. Die Clips werden den Prüfern in zufälliger Reihenfolge ohne Modellnamen vorgespielt. Die Prompts werden jedem Modell wie geschrieben übergeben, ohne Normalisierung auf unserer Seite. Bietet ein Modell eine Einstellung zur Textnormalisierung, verwenden wir deren Standardwert.

Der Satz umfasst vier Kategorien von Aussprache-Herausforderungen:

  • Contextually Appropriate (Contextual Disambiguation): gleich geschriebene Wörter, die je nach Kontext unterschiedlich gelesen werden, z. B. a wound that is bandaged vs. a bandage that is wound.
  • Expanding Shorthand (Text Normalization): Zahlen, Daten, Einheiten und Notation natürlich vorgelesen, z. B. 6'2", Chapter XVII oder 1 tsp of sugar.
  • Preserving Exact Sequences (Sequence Fidelity): Codes, Pfade, E-Mail-Adressen und Bezeichner exakt gesprochen, z. B. .env.local oder a.chen@ucsf.edu.
  • Standalone Terms (Term Pronunciation): Marken-, Orts- und Fachbegriffe korrekt ausgesprochen, z. B. Arkansas, façade oder genre.

Drei oder mehr unabhängige Prüfer beurteilen über 95 % der Clips jedes veröffentlichten Modells. Für jede hervorgehobene Passage beantworten sie mit Ja, Nein oder Ich konnte es nicht erkennen, ob sie natürlich und korrekt ausgesprochen wurde. Die Punktzahl eines Modells ist der Anteil der mit Ja beantworteten Urteile an Ja plus Nein. Antworten mit "Ich konnte es nicht erkennen" werden aus dem Nenner ausgeschlossen. Kategoriewerte verwenden dieselbe Formel über die Passagen der jeweiligen Kategorie. Fehlerbalken zeigen 95-%-Konfidenzintervalle, berechnet mit nach Passagen geclusterten Standardfehlern, da jede Passage von mehreren Prüfern beurteilt wird.

Wir veröffentlichen Ergebnisse für ein Modell, sobald mindestens 95 % der Beispiele des Satzes von drei oder mehr zugelassenen Prüfern abgedeckt sind.

Siehe die Pronunciation-Robustness-Übersicht für ein Beispiel der Bewertungskarte der Prüfer und Beispielclips für jedes Modell im Benchmark.

Preis pro 1 Mio. Zeichen

Für alle TTS-Modelle wird der Preis pro 1 Mio. Zeichen Eingabetext angegeben. Wenn ein Anbieter nicht direkt pro Zeichen abrechnet, leiten wir einen entsprechenden Preis ab:

  • Pro Zeichen: Der angegebene Tarif wird direkt verwendet
  • Abonnements: Effektiver Preis des günstigsten Abonnements, bei Verfügbarkeit auf Jahresbasis, das mindestens 1 Mio. Zeichen umfasst, bei angenommener Auslastung von 80 %
  • Tokenbasiert: Aus Batch-Preisen abgeleitet, indem Zeichen in Eingabetokens umgerechnet und die Dauer der Audioausgabe geschätzt wird
  • Ausgabedauer: Umgerechnet mit einer angenommenen Sprechgeschwindigkeit von 150 Wörtern pro Minute, entsprechend etwa 825 Zeichen pro Minute
  • Pro Byte: 1 UTF-8-Byte entspricht bei englischem Text ungefähr 1 Zeichen
  • Inferenzzeit: Anhand von Benchmark-Läufen mit ca. 25 Texten zu je ca. 500 Zeichen geschätzt
  • Modelle mit offenen Gewichten: Ohne Preis aufgeführt, sofern das Modell nicht auch über eine kostenpflichtige API angeboten wird; in diesem Fall wird dieser Tarif verwendet
  • Speech-to-Speech-Modelle: Abgeleitet aus den Kosten für die Spracherzeugung bei 20 festen TTS-Arena-Prompts auf Grundlage der ausgewiesenen Texteingabe, Audioausgabe, Textausgabe und separat ausgewiesenen Reasoning-/Thinking-Tokens. Textausgabetokens werden einbezogen, wenn sie als Teil der Audioantwort ausgewiesen werden. Cache-Effekte schließen wir aus, da die Prompts unabhängig voneinander als einstufige Anfragen ausgeführt werden und ihr Einfluss auf den Preis daher vernachlässigbar ist.

Durchsatz

Median der Zeichen des Eingabetexts, die der Anbieter pro Sekunde in Sprache umwandelt, berechnet über die vergangenen 3 Tage an Messungen. Für jede Generierung teilen wir die Zeichenzahl des Prompts durch die Zeit, die das Erzeugen und Empfangen des Clips benötigt.

Die Messung umfasst das Herunterladen des Audioclips vom Anbieter, sofern eine URL statt einer Audioantwort zurückgegeben wird. So bilden wir ab, wie Endnutzer einen generierten Audioclip tatsächlich erhalten, zumal URLs bereits vor Abschluss der Audioerzeugung bereitgestellt werden können. Audioclips werden, sofern relevant, mit Batchgröße 1 erzeugt.

Das Benchmarking wird viermal pro Tag durchgeführt. Für jede Benchmark-Evaluation wählen wir je Modell eine einzelne zufällige Stimme aus. Für jede Generierung wird ein eigener Prompt mit ca. 500 Zeichen verwendet.

So funktioniert die Arena

Jeder Vergleich zeigt zwei Audioclips, die aus demselben Text-Prompt erzeugt wurden. In der Provider Voice Arena stammen beide Clips aus derselben Geschlechts- und Akzentkategorie; in der Controlled Voice Arena verwenden beide dieselbe geklonte Referenzstimme. Die Modellnamen bleiben bis nach der Abstimmung verborgen, die Reihenfolge der Darstellung ist zufällig, und Hörerinnen und Hörer müssen einen Mindestanteil jedes Clips abspielen, bevor die Abstimmung freigeschaltet wird. Abgestimmt wird binär, ohne Unentschieden. Die Prompts verteilen sich auf vier Kategorien (Kundenservice, Unterhaltung, Wissensvermittlung und Assistenz) und enthalten auch anspruchsvolles Material wie alphanumerische Zeichenfolgen und Zahlenreihen; der Prompt-Satz wird laufend erneuert.

Die Audiosamples werden je Modell einmal erzeugt und vor dem Einsatz in der Arena standardisiert. So werden die Stimmen für ein Modell stets auf demselben Satz von Samples abgegeben, der vor der Freischaltung geprüft und normalisiert werden kann. Die Clips werden in ein einheitliches Wiedergabeformat konvertiert und auf eine gemeinsame Lautheit normalisiert, damit Unterschiede in Lautstärke oder Kodierung zwischen Anbietern die Stimmabgabe nicht beeinflussen.

Controlled Voice Arena

Die Controlled Voice Arena standardisiert die zur Evaluation jedes Text-to-Speech-Modells verwendeten Stimmen durch Stimmenklonen. Indem Modelle mit denselben Referenzstimmen verglichen werden, trennt sie die Präferenz der Zuhörer für eine bestimmte Stimme von allgemeineren Aspekten der Modellqualität, etwa Natürlichkeit der Sprache, Audioqualität, Aussprache, Sprechtempo und Prosodie. Das ermöglicht einen direkteren Vergleich der zugrunde liegenden Text-to-Speech-Modelle.

Für die Controlled Voice Arena besteht die englische Referenzauswahl aus acht professionell aufgenommenen Stimmen: zwei weiblichen und zwei männlichen Stimmen aus den USA sowie zwei weiblichen und zwei männlichen Stimmen aus dem Vereinigten Königreich. Wenn ein Modell die vollständige Referenzaufnahme akzeptiert, einschließlich Modellen, die sie selbstständig kürzen, stellen wir die vollständige Aufnahme bereit. Wenn ein Modell die Länge des Referenzaudios begrenzt, stellen wir stattdessen eine kürzere Version bereit, in der Regel 5 bis 10 oder 10 bis 15 Sekunden lang und an einer natürlichen Sprechpause geschnitten.

Über Englisch hinaus evaluiert die Controlled Voice Arena Modelle auch auf Spanisch, Französisch, Deutsch, Portugiesisch, Japanisch, Hindi, Mandarin-Chinesisch, Arabisch und Vietnamesisch. Für jede nicht englische Sprache umfasst die Referenzauswahl eine professionell aufgenommene männliche und eine professionell aufgenommene weibliche Stimme, beide von Muttersprachlern aufgenommen. Auch innerhalb jeder Sprache werden die Stimmen durch Stimmenklonen standardisiert, während Präferenz-Votes von Bewertenden erhoben werden, die so ausgewählt sind, dass die jeweils bewertete Sprache ihre Erstsprache ist. Jedes Modell wird nur in den Sprachen evaluiert, die es unterstützt, und ein sprachspezifisches Leaderboard wird veröffentlicht, sobald die Modelle genügend Vergleiche für stabile Elo-Bewertungen gesammelt haben.

Die Controlled Voice Arena ergänzt unsere Provider Voice Arena, in der jedes Modell anhand einer repräsentativen Auswahl seiner eigenen öffentlich verfügbaren Stimmen evaluiert wird.

Wählen Sie unten eine kontrollierte Stimme aus, um ihre Referenzaufnahme anzuhören.

Provider Voice Arena

Die Provider Voice Arena evaluiert jedes Text-to-Speech-Modell mit einer repräsentativen Auswahl der Stimmen, die der Anbieter des Modells bereitstellt. Sie ergänzt die Controlled Voice Arena, in der Modelle mit denselben geklonten Referenzstimmen verglichen werden. Anbieterstimmen bilden ab, wie Nutzer ein Modell üblicherweise über dessen öffentliche API, Produktoberfläche oder Dokumentation erleben.

Für jedes Modell wählen wir mehrere vom Anbieter bereitgestellte Stimmen aus, damit der Vergleich repräsentativ und fair ist. Für jede Kombination aus männlich und weiblich sowie US-amerikanischem und britischem Akzent wählen wir zwei Stimmen aus, insgesamt also acht. Ist eine Kombination aus Geschlecht und Akzent nicht verfügbar, schließen wir sie von der Evaluation in der Provider Voice Arena aus.

Die Stimmen werden anhand ihrer Sichtbarkeit in den Oberflächen und der Dokumentation des Anbieters ausgewählt. Stimmen, die nicht neutral ausgeprägt sind, etwa stark stilisierte regionale Akzente, werden ausgeschlossen. Modellentwickler können bei einer großen Auswahl auch die Verwendung bestimmter Stimmen anfragen. Werden keine Anbieterstimmen bereitgestellt, wie es üblicherweise bei Open-Source-Modellen der Fall ist, verwenden wir Sprachaufnahmen professioneller Sprecher als Quelldateien für die Spracherzeugung (Beispiele finden Sie oben unter „Controlled Voice Arena“).

Wählen Sie unten einen Modellentwickler aus, um die derzeit für seine Modelle verwendeten Anbieterstimmen anzuzeigen.

Qualität der Abstimmenden

Der Großteil der von uns veröffentlichten Bewertungen stammt aus einem bezahlten Panel mit guter Erfolgsbilanz in vergleichbaren Projekten und umfasst sowohl Präferenz-Votes in den Arenen als auch die Prüfungen für Pronunciation Robustness. Für die englischsprachigen Arenen und für Pronunciation Robustness werden die Panelmitglieder als englische Muttersprachler mit Wohnsitz in den USA oder Großbritannien ausgewählt. Für jede nicht englische Sprache der Controlled Voice Arena erfolgt die Auswahl über die Erstsprache, wobei die Bewertenden nach Möglichkeit in ihrem Herkunftsland leben, sodass sie Muttersprachler der jeweils bewerteten Sprache sind.

Die Sitzungen für Pronunciation Robustness enthalten Aufmerksamkeitskontroll-Clips mit bekannten Antworten; Prüfende, die eine beantwortete Kontrolle verfehlen, werden vollständig ausgeschlossen. Stimmen aus den Arenen durchlaufen eine automatisierte Qualitätsprüfung, bevor sie in die Rangfolge einfließen. Bezahlte Prüfende sehen niemals Modellnamen. Wir vergleichen die Rangfolgen aus dem bezahlten und dem öffentlichen Pool laufend als Konsistenzprüfung.

Aufnahmekriterien für Modelle und Anbieter

Unser Ziel ist es, beliebte und leistungsstarke Text-to-Speech-Modelle und -Anbieter zu analysieren und zu vergleichen, um Endnutzer bei ihrer Auswahl zu unterstützen. Daher prüfen wir die Branchenrelevanz und Wettbewerbsfähigkeit neuer Modelle und Anbieter, bevor wir sie aufnehmen. Wir entwickeln diese Kriterien derzeit weiter und freuen uns über Feedback und Vorschläge. Modelle oder Anbieter können über die Kontaktseite vorgeschlagen werden. Veröffentlicht ein Anbieter ein wesentliches Update eines Modells, führen wir es als neue, datierte Variante, erzeugen sämtliche Arena-Samples neu und bewerten es ohne übernommene Stimmen. Frühere Varianten bleiben gelistet, solange sie die Kriterien erfüllen.

Unabhängigkeitserklärung

Das Benchmarking erfolgt unter strikter Wahrung von Unabhängigkeit und Objektivität. Artificial Analysis erhält von keinem Anbieter eine Vergütung für die Aufnahme in die Liste oder für positive Ergebnisse.