Methodik für das Text-to-Speech-Benchmarking
Umfang und Hintergrund
Artificial Analysis führt Benchmarks für Text-to-Speech-Modelle durch, die über serverlose API-Endpunkte angeboten werden. Diese Seite beschreibt unsere Methodik für das Text-to-Speech-Benchmarking einschließlich der Qualitäts- und Leistungsbenchmarks. Text-to-Speech-Endpunkte gelten für uns als serverlos, wenn Kunden nur für die Nutzung und nicht einen festen Preis für den Zugang zahlen.
Sowohl beim Leistungsbenchmarking als auch in der Speech Arena konzentrieren wir uns darauf, die Erfahrung von Endnutzern serverloser APIs abzubilden. Wir messen insbesondere die Zeit, bis die Audiodatei lokal empfangen wird. Wenn die API statt Bytes eine URL zurückgibt, beziehen wir die Downloadzeit der Datei in die Messung der Antwortzeit ein. Wir verwenden die Standardimplementierung der Anbieter-APIs gemäß der jeweiligen Anbieterdokumentation. Sofern die API des Anbieters diese Option bietet, standardisieren wir die Abtastrate des Audios auf 22,05 kHz.
Wichtige Metriken
Mit den folgenden Metriken erfassen wir Qualität, Leistung und Preis von Text-to-Speech-Modellen.
Qualitäts-Elo
Relativer Elo-Wert der Modelle, ermittelt anhand der Nutzerstimmen in der Artificial Analysis Text to Speech Arena.
Manche Modelle werden möglicherweise noch nicht angezeigt, weil sie nicht genügend Stimmen erhalten haben. Wir verwenden ein ähnliches lineares Regressionsmodell wie bei der Berechnung der Elo-Werte für die Chatbot Arena durch LMSYS.
Preis pro 1 Mio. Zeichen
Für alle TTS-Modelle wird der Preis pro 1 Mio. Zeichen Eingabetext angegeben. Wenn ein Anbieter nicht direkt pro Zeichen abrechnet, leiten wir einen entsprechenden Preis ab:
- Pro Zeichen: Der angegebene Tarif wird direkt verwendet
- Abonnements: Effektiver Preis des günstigsten Abonnements, bei Verfügbarkeit auf Jahresbasis, das mindestens 1 Mio. Zeichen umfasst, bei angenommener Auslastung von 80 %
- Tokenbasiert: Aus Batch-Preisen abgeleitet, indem Zeichen in Eingabetokens umgerechnet und die Dauer der Audioausgabe geschätzt wird
- Ausgabedauer: Umgerechnet mit einer angenommenen Sprechgeschwindigkeit von 150 Wörtern pro Minute, entsprechend etwa 825 Zeichen pro Minute
- Pro Byte: 1 UTF-8-Byte entspricht bei englischem Text ungefähr 1 Zeichen
- Inferenzzeit: Anhand von Benchmark-Läufen mit ca. 25 Texten zu je ca. 500 Zeichen geschätzt
- Modelle mit offenen Gewichten: Keine kommerziellen API-Preise; ohne Preis aufgeführt
- Speech-to-Speech-Modelle: Abgeleitet aus den Kosten für die Spracherzeugung bei 20 festen TTS-Arena-Prompts auf Grundlage der ausgewiesenen Texteingabe, Audioausgabe, Textausgabe und separat ausgewiesenen Reasoning-/Thinking-Tokens. Textausgabetokens werden einbezogen, wenn sie als Teil der Audioantwort ausgewiesen werden. Cache-Effekte schließen wir aus, da die Prompts unabhängig voneinander als einstufige Anfragen ausgeführt werden und ihr Einfluss auf den Preis daher vernachlässigbar ist.
Bei Preisangaben berücksichtigen wir keine vorübergehenden Rabatte.
Generierungszeit
Median der Zeit, die ein Anbieter zum Erzeugen eines einzelnen Audioclips mit ca. 500 Eingabezeichen benötigt, berechnet anhand der Messungen der vergangenen 14 Tage.
Die Generierungszeit umfasst den Download des Audioclips vom Anbieter, wenn dieser statt einer Audioantwort eine URL bereitstellt. Damit bilden wir die Latenz ab, die Endnutzer bis zum Empfang eines erzeugten Audioclips erleben, denn URLs können bereits vor Fertigstellung des Audios erzeugt werden. Audioclips werden, sofern relevant, mit einer Batch-Größe von 1 erzeugt.
Das Benchmarking wird viermal täglich zu zufälligen Tageszeiten durchgeführt. Für jede Benchmark-Evaluation wählen wir je Modell eine einzelne zufällige Stimme aus. Für jede Generierung wird ein eigener Prompt mit ca. 500 Zeichen verwendet.
Kontrollierte Stimmen
Die Controlled Voice Arena standardisiert die zur Evaluation jedes Text-to-Speech-Modells verwendeten Stimmen durch Stimmenklonen. Indem Modelle mit denselben Referenzstimmen verglichen werden, trennt sie die Präferenz der Zuhörer für eine bestimmte Stimme von allgemeineren Aspekten der Modellqualität, etwa Natürlichkeit der Sprache, Audioqualität, Aussprache, Sprechtempo und Prosodie. Das ermöglicht einen direkteren Vergleich der zugrunde liegenden Text-to-Speech-Modelle.
Die Controlled Voice Arena ergänzt unsere Provider Voice Arena, in der jedes Modell anhand einer repräsentativen Auswahl seiner eigenen öffentlich verfügbaren Stimmen evaluiert wird. Die Referenzauswahl besteht aus acht professionell aufgenommenen Stimmen: zwei weiblichen und zwei männlichen Stimmen aus den USA sowie zwei weiblichen und zwei männlichen Stimmen aus dem Vereinigten Königreich. Wählen Sie unten eine kontrollierte Stimme aus, um ihre Referenzaufnahme anzuhören.
Anbieterstimmen
Die Provider Voice Arena evaluiert jedes Text-to-Speech-Modell mit einer repräsentativen Auswahl der Stimmen, die der Anbieter des Modells bereitstellt. Sie ergänzt die Controlled Voice Arena, in der Modelle mit denselben geklonten Referenzstimmen verglichen werden. Anbieterstimmen bilden ab, wie Nutzer ein Modell üblicherweise über dessen öffentliche API, Produktoberfläche oder Dokumentation erleben.
Für jedes Modell wählen wir mehrere vom Anbieter bereitgestellte Stimmen aus, damit der Vergleich repräsentativ und fair ist. Für jede Kombination aus männlich und weiblich sowie US-amerikanischem und britischem Akzent wählen wir zwei Stimmen aus, insgesamt also acht. Ist eine Kombination aus Geschlecht und Akzent nicht verfügbar, schließen wir sie von der Evaluation in der Provider Voice Arena aus.
Die Stimmen werden anhand ihrer Sichtbarkeit in den Oberflächen und der Dokumentation des Anbieters ausgewählt. Stimmen, die nicht neutral ausgeprägt sind, etwa stark stilisierte regionale Akzente, werden ausgeschlossen. Modellentwickler können bei einer großen Auswahl auch die Verwendung bestimmter Stimmen anfragen. Werden keine Anbieterstimmen bereitgestellt, wie es üblicherweise bei Open-Source-Modellen der Fall ist, verwenden wir Sprachaufnahmen professioneller Sprecher als Quelldateien für die Spracherzeugung (Beispiele finden Sie oben unter „Kontrollierte Stimmen“).
Wählen Sie unten einen Modellentwickler aus, um die derzeit für seine Modelle verwendeten Anbieterstimmen anzuzeigen.
Aufnahmekriterien für Modelle und Anbieter
Unser Ziel ist es, beliebte und leistungsstarke Text-to-Speech-Modelle und -Anbieter zu analysieren und zu vergleichen, um Endnutzer bei ihrer Auswahl zu unterstützen. Daher prüfen wir die Branchenrelevanz und Wettbewerbsfähigkeit neuer Modelle und Anbieter, bevor wir sie aufnehmen. Wir entwickeln diese Kriterien derzeit weiter und freuen uns über Feedback und Vorschläge. Modelle oder Anbieter können über die Kontaktseite vorgeschlagen werden.
Das Benchmarking wird viermal täglich zu zufälligen Tageszeiten durchgeführt. Für jede Benchmark-Evaluation wählen wir je Modell eine einzelne zufällige Stimme aus. Für jede Generierung wird ein eigener Prompt mit ca. 500 Zeichen verwendet.
Unabhängigkeitserklärung
Das Benchmarking erfolgt unter strikter Wahrung von Unabhängigkeit und Objektivität. Artificial Analysis erhält von keinem Anbieter eine Vergütung für die Aufnahme in die Liste oder für positive Ergebnisse.