Methodik des Speech-to-Text-Benchmarkings

Artificial Analysis bewertet Speech-to-Text-Modelle (STT), auch bekannt als Modelle zur automatischen Spracherkennung (ASR), hinsichtlich Genauigkeit, Geschwindigkeit und Preis. Wir benchmarken sowohl Transkription ohne Streaming (auch als Offline- oder Batch-Transkription bezeichnet) als auch Streaming-Transkription. Genauigkeit (WER), Normalisierung, Datensätze und Kriterien für die Modellaufnahme gelten für beide gleichermaßen. Die folgenden Abschnitte definieren zunächst diese gemeinsamen Grundlagen und behandeln anschließend die spezifischen Metriken der Batch- und Streaming-Bewertung.

Wichtige Metriken

Wortfehlerrate (WER)

Die Wortfehlerrate (Word Error Rate, WER) misst die Transkriptionsgenauigkeit, indem die Modellausgabe mit einem Referenztranskript (einer verifizierten menschlichen Transkription) verglichen wird.

Formel:

WER = (Ersetzungen + Einfügungen + Löschungen) ÷ Wörter in der Referenz

Beispiel:

  • Referenz: the cat sat on the mat
  • Hypothese: cat is on the big mat
  • Fehler: Löschung (the), Ersetzung (sat → is), Einfügung (big)
  • WER = 3 ÷ 6 = 50%

Weitere Einzelheiten finden Sie im Abschnitt Bewertung der Wortfehlerrate (WER).

Geschwindigkeitsfaktor (Batch)

Gibt an, wie schnell eine API für Batch-Transkription Audio im Verhältnis zur tatsächlichen Länge dieses Audios transkribiert.

  • Ein Wert über 1 bedeutet, dass der Dienst schneller als in Echtzeit transkribiert (z. B. bedeutet 2,0, dass 10 Minuten Audio in 5 Minuten transkribiert werden können).

Unser Batch-Benchmark berücksichtigt die Netzwerklatenz. Die unter Geschwindigkeitsfaktor im Zeitverlauf dargestellten Punkte sind der Median aus vier zufällig angesetzten Messungen innerhalb eines Zeitraums von 24 Stunden. Die für den Geschwindigkeitsfaktor dargestellten Balken zeigen den Median der letzten 7 Tage.

Formel:

Geschwindigkeitsfaktor = Audiodauer ÷ API-Antwortzeit

Latenzmetriken (Streaming)

Für Streaming-Modelle geben wir zwei Latenzmetriken an:

  • Zeit bis zum finalen Transkript: Zeit bis zur Ausgabe des ersten als final gekennzeichneten Transkripts nach Erkennung des Sprachendes durch SileroVAD.
  • Zeit bis zum ersten vorläufigen Transkript: Zeit bis zur Ausgabe des ersten als vorläufig gekennzeichneten Transkripts nach Erkennung des Sprachendes durch SileroVAD.

Messdetails finden Sie im Abschnitt Streaming-Speech-to-Text.

Preis pro 1.000 Minuten

Gibt die geschätzten Kosten für die Transkription von 1.000 Minuten Audio an, normiert über Anbieter mit unterschiedlichen Abrechnungsmodellen hinweg.

So berechnen wir diesen Wert

  • Audiodauer: Verwendet den vom Anbieter veröffentlichten, auf der Dauer basierenden Transkriptionspreis.
  • Verarbeitungszeit: Misst die Verarbeitungszeit anhand einer vielfältigen Audiostichprobe und rechnet die Gebühren für die Verarbeitungszeit in Kosten pro 1.000 Audiominuten um.
  • Token: Misst die abgerechnete Token-Nutzung anhand einer repräsentativen Audiostichprobe und rechnet die beobachteten Ausgaben in Kosten pro 1.000 Audiominuten um. Wenn Anbieter separate Reasoning-Token ausweisen, werden diese ausdrücklich einbezogen. Andernfalls können die abgerechneten Ausgabe-Token sowohl die sichtbare Ausgabe als auch interne Reasoning-Token umfassen.
  • Abonnement: Verwendet den Tarif mit den niedrigsten Vorabkosten, der unter den angegebenen Beschränkungen des Anbieters realistisch 1.000 Minuten Transkription pro Monat ermöglicht.

Einheitliche Maßeinheit

In allen Fällen werden die Preise in dieselbe Einheit umgerechnet: geschätzte Kosten pro 1.000 Minuten transkribierten Audios.

Bewertung der Wortfehlerrate (WER)

Artificial Analysis führt unabhängige WER-Tests für alle Modell-Anbieter-Kombinationen durch.

Wichtige Details:

  • API-Endpunkte werden direkt getestet, um die Leistung aus Sicht der Endnutzer abzubilden.
  • Aktuelle Bewertung: ~8 Stunden Audio aus AA-AgentTalk, VoxPopuli-Cleaned-AA und Earnings22-Cleaned-AA (Details unten). Die Ergebnisse innerhalb jedes Datensatzes werden als zeitgewichteter Durchschnitt berechnet. Anschließend bilden wir einen gewichteten Durchschnitt aus 50% AgentTalk, 25% VoxPopuli und 25% Earnings22, um unser AA-WER-Ergebnis zu erhalten.
  • Wenn Modelle Prompts unterstützen, verwenden wir: "Transcribe the audio verbatim, outputting only spoken words in sequence."

Datensätze

  1. AA-AgentTalk (proprietär, zurückgehalten): Ein von Artificial Analysis entwickelter proprietärer Evaluierungsdatensatz mit Schwerpunkt auf Sprache, die für Anwendungsfälle von Sprachagenten relevant ist. Weitere Einzelheiten finden Sie in unserem Blogbeitrag.

    • Anzahl der Stichproben: 469
    • Dauer der Stichproben: 8–109 Sekunden
    • Gesamtdauer: ~250 Minuten
  2. VoxPopuli-Cleaned-AA: Sitzungen des Europäischen Parlaments.

    • Teilmenge: Englisch
    • Anzahl der Stichproben: 628
    • Dauer der Stichproben: 5–38 Sekunden
    • Gesamtdauer: ~119 Minuten
  3. Earnings22-Cleaned-AA: Telefonkonferenzen zu Unternehmensergebnissen mit Fachsprache und sich überschneidenden Sprechern.

    • Anzahl der Stichproben: 6
    • Dauer der Stichproben: ~14–22 Minuten
    • Gesamtdauer: ~115 Minuten

Weitere Einzelheiten zu VoxPopuli-Cleaned-AA und Earnings22-Cleaned-AA finden Sie in unserem Blogbeitrag. Die aktuelle Version der bereinigten Transkripte in beiden Repositorys ist Version 1.0, die in AA-WER v2 verwendet wird.

Diese bereinigten Transkripte stellen unseren bestmöglichen Versuch einer wortgetreuen Ground Truth dar, gestützt auf manuelle Prüfung und Gegenvalidierung im gesamten Datensatz. Zukünftige Verbesserungen werden als nachfolgende Versionen veröffentlicht. Wenn Ihnen Probleme auffallen, freuen wir uns über Rückmeldungen über unsere Kontaktseite oder auf Discord.

Audiosegmentierung (Earnings22)

Earnings22 enthält längere Dateien (~14–22 Minuten), daher unterscheidet sich die Segmentierung je nach Bewertungsmodus und Modellkonfiguration. Bei der Transkription ohne Streaming (Batch/Offline) bewerten wir standardmäßig das vollständige übergeordnete Audio. Wenn Modell- oder API-Beschränkungen kürzere Eingaben erfordern oder Segmentierung notwendig ist, um Kürzungen oder Zeitüberschreitungen zu vermeiden, teilen wir Earnings22 zunächst in ungefähr 9-minütige Segmente und nur bei Bedarf in ungefähr 30-sekündige Segmente auf. Bei der Streaming-Transkription verwenden die meisten Earnings22-Durchläufe ungefähr 30-sekündige Segmente, deren Ergebnisse wieder auf Ebene der übergeordneten Telefonkonferenzen aggregiert werden. Einige Streaming-Konfigurationen werden mit dem vollständigen übergeordneten Audio bewertet, wenn dies dem Verhalten des Anbieterendpunkts besser entspricht. Segmentgrenzen werden nach Möglichkeit an Sprachgrenzen gesetzt, um Wörter nicht in der Mitte zu trennen. Die Stichproben von AA-AgentTalk und VoxPopuli sind kurz genug, dass keine Segmentierung erforderlich ist.

Bei segmentiertem Earnings22-Audio aggregieren wir die Ergebnisse wieder auf Ebene der übergeordneten Telefonkonferenz:

  • WER: Die Segmenttranskripte werden wieder zu ihrer übergeordneten Telefonkonferenz zusammengefügt, und die WER wird anhand des kombinierten Transkripts im Vergleich zur Ground Truth der übergeordneten Telefonkonferenz berechnet. Anschließend wird die WER über die übergeordneten Telefonkonferenzen hinweg nach Audiodauer gewichtet, wie bei allen anderen Datensätzen.
  • Streaming-Latenz: Die Zeit bis zum finalen Transkript und die Zeit bis zum ersten vorläufigen Transkript werden als einfacher Durchschnitt über die Segmente aggregiert.

Audiostichproben

"Fantastic, the blog post about remote work best practices is ready to publish. The interview quotes from our distributed team members add authenticity, and the productivity statistic from Buffer's study support our main points. Schedule it for Tuesday at ten AM and promote it across our social channels. This should drive good engagement with our HR software prospects."

"I'd like to speak with someone about setting up a payment plan for my outstanding balance. My account has been past due for about two months now. The account is A A C, excuse me, A C C nine nine five two seven."

"Also can you adjust the Philips Hue bulbs in the dining room to that warm amber setting turn down the chandelier to about thirty percent brightness?"

Original: "Mr President, I have another complaint about this procedure, which is that it is not secret."

Bereinigt: "Thank you Mr President, I have another complaint about this procedure, which is that it's not secret."

Original: "Furthermore the AFET opinion divides eligible countries into candidate, potential candidate, neighbourhood and in exceptional and duly justified circumstances strategically important third counties."

Bereinigt: "Furthermore, the opinion of AFET divides eligible countries into candidate, potential candidate, neighbourhood and, in exceptional and duly justified circumstances, strategically important third countries."

"Thank you, Darcy, and welcome everyone to our December quarterly analyst call. December quarterly production showed a considerable improvement on the September quarter with record production throughput and improving grades, improving recoveries and improving cash flow. Unfortunately, delays accessing higher grade parts of the open pit resulted in lower grades than projected in our guidance. On the exploration front, today we announced a 70% increase in our 100% owned Yamarna resources. So they now sit at 0.5 million ounces..."

Normalisierungsverfahren

Vor dem Vergleich werden sowohl die Referenz (Ground Truth) als auch die Transkriptionshypothese des Modells mit dem Whisper-Normalisierer von OpenAI normalisiert:

  • Gesamten Text in Kleinbuchstaben umwandeln; Text in eckigen Klammern und Füllwörter ("uh", "um") entfernen; Leerzeichen normalisieren
  • Kontraktionen auflösen (won't vs. will not, I'm vs. I am)
  • Zahlen vereinheitlichen (twenty five vs. 25, two point five vs. 2.5)
  • Interpunktion/Symbole normalisieren (nicht bedeutungstragende Zeichen entfernen, Währungen/Prozentangaben vereinheitlichen)
  • Schreibweisen vereinheitlichen (z. B. colour vs. color)

Zusätzlich zum Whisper-Normalisierer von OpenAI haben wir weitere Normalisierungen ergänzt:

  • Formatierung von Ziffern, IDs und Telefonnummern für gleichwertige kompakte, mit Leerzeichen getrennte, geklammerte und mit Bindestrichen gruppierte Formen (z. B. 1405 553 272 vs. 1405553272, (303) 775-4498 vs. 303 775 4498, CLM-2024-0873 vs. CLM 2024 0873)
  • Durch einzelne Buchstaben dargestellte Namen und buchstabierte Buchstabenfolgen mit unterschiedlichen Trennzeichen (z. B. S I N G H vs. S-I-N-G-H, A B C vs. A-B-C)
  • Beibehaltung führender Nullen und Normalisierung gleichwertiger gesprochener Symbolformen (z. B. 06100052, + vs. plus, engagement underscore rate vs. engagement_rate)
  • Zeitformatierung für gleichwertige Uhrzeitformen (z. B. 7:00pm vs. 7pm, 10:30 AM vs. ten thirty AM)
  • Ergänzung weiterer gleichwertiger Schreibweisen im US-amerikanischen und britischen Englisch (z. B. totalled vs totaled)
  • Akzeptierte gleichwertige Schreibweisen für mehrdeutige Eigennamen in unserem Datensatz (z. B. Mateo vs. Matteo)
  • Formatierung numerischer Bereiche, wenn Endpunkte und Einheiten übereinstimmen (z. B. 15-20 minutes vs. fifteen to twenty minutes, 6-8% vs. six to eight percent)
  • Gängige Varianten bei Leerzeichen und Bindestrichen, wenn die Bedeutung unverändert bleibt (z. B. hard-coded vs. hardcoded, up front vs. upfront, Sea-Tac vs. SeaTac)
  • Beibehaltung bedeutungstragender Codes und Symbole, wenn eine Auslassung oder Ersetzung das Transkript verändert (z. B. F-150, W-2, $50, 5%)
  • Wiederholte gesprochene Ausdrücke für große Zahlen werden getrennt beibehalten und nicht zu einer neuen Zahl zusammengefasst (z. B. wird twelve million twelve million zu 12,000,000 12,000,000 und nicht zu 24,000,000)
  • Transkribierter Inhalt in eckigen Klammern wird beibehalten, während Annotationstags wie [music], '<unk>' und language English'<asr_text>' entfernt werden

Beispiel:

  • Ground Truth: Hello, I'm Dr. Smith. I have twenty-five patients today.
  • Modellausgabe: hello i am doctor smith i have 25 patients today
  • Nach der Normalisierung: hello i am doctor smith i have 25 patients today

WER-Berechnung

  • Die WER basiert auf der Levenshtein-Distanz. Sie richtet zwei Sequenzen aneinander aus, indem sie die optimale Anzahl von Ersetzungen, Einfügungen und Löschungen ermittelt, die erforderlich sind, um eine Sequenz in die andere umzuwandeln.
  • In diesem Zusammenhang misst sie die Bearbeitungen, die nötig sind, um die Transkription des Modells (Hypothese) wieder in das verifizierte menschliche Transkript (Referenz) umzuwandeln.
  • Die Ergebnisse innerhalb der Datensätze werden als nach Audiodauer gewichtete durchschnittliche WER aggregiert, damit zahlreiche kurze Clips die Ergebnisse gegenüber längeren Dateien nicht verzerren.

Streaming-Speech-to-Text

Der Streaming-Benchmark bildet insbesondere für Anwendungsfälle von Sprachagenten die Genauigkeit von Streaming-Modellen ab und wahrt zugleich die Vergleichbarkeit mit dem obigen Batch-Benchmark. WER, Normalisierung, Datensätze, Gewichtung und Audiosegmentierung sind wie oben definiert. Wir geben die WER des finalen Transkripts und separat die WER des ersten vorläufigen Transkripts nach dem Sprachende an.

Beim Streaming werden die Latenzmetriken innerhalb jedes Datensatzes nach Stichproben gewichtet, während die WER weiterhin nach Audiodauer gewichtet wird. Für segmentiertes Earnings22-Audio gilt der obige Hinweis zur Aggregation segmentierter Daten.

Streaming-Funktionsweise

Audio wird in Echtzeit in 20-ms-Segmenten oder gemäß der öffentlich empfohlenen Modellkonfiguration gestreamt. Streaming-STT-Modelle geben zwei Arten von Transkripten zurück:

  • Vorläufige Transkripte: noch nicht bestätigt, Änderungen vorbehalten.
  • Finale Transkripte: bestätigt, keine weiteren Änderungen.

Die Netzwerkverzögerung ist in allen Latenzmessungen enthalten. Sie bildet bei proprietären Modellen die tatsächliche Erfahrung der Endnutzer ab und kann die Vereinheitlichung zwischen Anbietern erschweren.

Erzwungenes Endpointing

Bei den meisten Modellen können wir zu einem bestimmten Zeitpunkt ein finales Transkript auslösen, etwa wenn ein separates VAD das Sprachende erkennt. Dies ist relevant, da Entwickler von Sprachagenten häufig ein separates, abgestimmtes Endpointing-Modell einsetzen, um zu steuern, wie aggressiv Transkripte abgerufen werden. Modelle mit Unterstützung für erzwungenes Endpointing werden auf dem unten beschriebenen Standardpfad bewertet; Modelle ohne diese Unterstützung werden anhand der Ausweichlogik bewertet (siehe die Details zur Zeitmessungslogik unten).

Wenn ein Anbieter eine Endpoint-bezogene Konfiguration bereitstellt, stellen wir sie so ein, dass nur das Signal für erzwungenes Endpointing ein finales Transkript auslöst. Für diesen Anwendungsfall verwenden wir die öffentlich empfohlene Konfiguration des Anbieters.

Zeitmessungslogik: erzwungenes Endpointing unterstützt

  • Wir streamen Audio in Echtzeit. Wenn SileroVAD das Sprachende erkennt, senden wir die force-endpoint-Anfrage.
  • Der Timer für die Zeit bis zum finalen Transkript startet zu dem tatsächlichen Zeitpunkt, an dem das Audio bis zum Sprachendepunkt gestreamt und das force-endpoint-Signal gesendet wurde, nicht beim Sprachende-Zeitstempel der Audiodatei. Dadurch wird verhindert, dass Abweichungen im Wiedergabetempo der Testumgebung oder des Modells die Latenz verfälschen.
  • Der Timer stoppt beim nächsten finalen Transkript des Modells; die WER wird anhand der kombinierten finalen Transkripte berechnet.
  • Wenn das Modell bereits vor dem Auslösen von SileroVAD ein finales Transkript ausgegeben hat, verwenden wir das neueste.
  • Die Zeit bis zum ersten vorläufigen Transkript wird auf dieselbe Weise gemessen und endet mit dem ersten vorläufigen Transkript, das nach dem force-endpoint-Signal empfangen wird.

Zeitmessungslogik: erzwungenes Endpointing nicht unterstützt

  • Das erste natürliche finale Transkript innerhalb von 2 s nach dem von SileroVAD erkannten Sprachende verwenden.
  • Wenn innerhalb von 2 s kein natürliches finales Transkript erscheint, das erste vorläufige Transkript verwenden, das nach 2 s eintrifft.
  • Wenn nach 2 s nichts eintrifft, das letzte vorläufige Transkript vor Ablauf der 2 s verwenden.

Ausgewiesene Metriken

Die finale WER wird aus den kombinierten finalen Transkripten sowie dem anhand der obigen Logik ausgewählten finalen Transkript oder vorläufigen Ersatztranskript berechnet. Die vorläufige WER wird dagegen aus den kombinierten finalen Transkripten sowie dem anhand der obigen Logik ausgewählten vorläufigen Transkript nach dem Endpunkt berechnet. Beide werden mit dem vollständigen Ground-Truth-Transkript verglichen. Da das erste vorläufige Transkript nach dem Endpunkt in der Regel einen früheren Stand der Streaming-Ausgabe des Modells abbildet, werden die vorläufige WER und die finale WER getrennt ausgewiesen und nicht direkt miteinander verglichen.

Kriterien für die Modellaufnahme

Unser Ziel ist es, die beliebtesten und leistungsfähigsten Speech-to-Text-Modelle abzubilden, damit Endnutzer fundiert entscheiden können, welche Modelle und Anbieter sie verwenden möchten. Daher prüfen wir die Branchenrelevanz und Wettbewerbsfähigkeit, um über die Aufnahme neuer Modelle und Anbieter zu entscheiden. Wir arbeiten derzeit an der weiteren Ausgestaltung dieser Kriterien und freuen uns über Rückmeldungen und Vorschläge. Modellvorschläge können Sie uns über die Kontaktseite senden.

Versionsverlauf

AA-WER v2.2

Mai 2026–heute

  • Der Normalisierer für den Vergleich englischer Texte wurde erneut aktualisiert, um weitere bedeutungsgleiche Transkriptionsvarianten als gleichwertig zu behandeln, während Auslassungen oder Ersetzungen mit Bedeutungsunterschied weiterhin als Fehler gewertet werden:
    • Unicode-Apostrophvarianten bei gleichwertigen Formulierungen (z. B. we’re vs. we're)
    • Formatierung vorzeichenbehafteter Prozentangaben bei gleicher Bedeutung (z. B. -12% vs. negative twelve percent)
    • Dezimalgruppierung ohne Währungszeichen (z. B. 99.99 vs. ninety-nine ninety-nine), wobei fehlende Währungssymbole weiterhin als Fehler gewertet werden (z. B. entspricht $71.50 nicht seventy-one fifty)
    • Reine Formatierungsvarianten bei Binde- und Gedankenstrichen (z. B. 18-year-old vs. 18 year old)
    • Technische Interpunktion in eindeutigen Code-, URL- und E-Mail-Kontexten (z. B. UserController.java vs. UserController dot java, /v1/users vs. slash v1 slash users, gmail.com vs. gmail dot com)
    • Versions-, Dezimal- und Bruchvarianten, bei denen gesprochene und geschriebene Form übereinstimmen (z. B. version 1.24.3 vs. version one point twenty-four dot three, 1.0 vs. one point zero, 1.25 inches vs. one and a quarter inches)
    • Einheitenabkürzungen bei unveränderter Bedeutung (z. B. mg/dL vs. milligrams per deciliter, GB vs. gigabytes)
  • Einführung der Bewertung von Streaming-Speech-to-Text mit den Latenzmetriken Zeit bis zum finalen Transkript und Zeit bis zum ersten vorläufigen Transkript.

AA-WER v2.1

April 2026–Mai 2026

  • Der Normalisierer für den Vergleich englischer Texte wurde aktualisiert, um weitere bedeutungsgleiche Transkriptionsvarianten als gleichwertig zu behandeln, während Auslassungen oder Ersetzungen mit Bedeutungsunterschied weiterhin als Fehler gewertet werden:
    • Formatierung von IDs und Telefonnummern, wenn Bindestriche oder Leerzeichen nur zur Zifferngruppierung dienen (z. B. 303-775-4498 vs. 303 775 4498, CLM-2024-0873 vs. CLM 2024 0873)
    • Durch einzelne Buchstaben dargestellte Namen und buchstabierte Buchstabenfolgen mit unterschiedlichen Trennzeichen (z. B. S I N G H vs. S-I-N-G-H)
    • Formatierung numerischer Bereiche, wenn Endpunkte und Einheiten übereinstimmen (z. B. 15-20 minutes vs. fifteen to twenty minutes, 6-8% vs. six to eight percent)
    • Gängige Varianten bei Leerzeichen und Bindestrichen, wenn die Bedeutung unverändert bleibt (z. B. hard-coded vs. hardcoded, up front vs. upfront, Sea-Tac vs. SeaTac)
    • Beibehaltung bedeutungstragender Codes und Symbole, wenn eine Auslassung oder Ersetzung das Transkript verändert (z. B. F-150, W-2, $50, 5%)
    • Wiederholte gesprochene Ausdrücke für große Zahlen werden getrennt beibehalten und nicht zu einer neuen Zahl zusammengefasst (z. B. wird twelve million twelve million zu 12,000,000 12,000,000 und nicht zu 24,000,000)
    • Transkribierter Inhalt in eckigen Klammern wird beibehalten, während Annotationstags wie [music], '<unk>' und language English'<asr_text>' entfernt werden

AA-WER v2.0

Februar 2026–heute

  • Einführung von AA-AgentTalk, einem neuen proprietären Evaluierungsdatensatz (Gewichtung: 50%) für Anwendungsfälle von Sprachagenten, der als privater, zurückgehaltener Testsatz dient.
  • Bereinigung der Ground-Truth-Transkripte für VoxPopuli und Earnings22 durch Korrektur von Fehlern in den Referenztranskriptionen, um eine fairere Bewertung zu gewährleisten.
  • Entfernung von AMI SDM aus dem Benchmark aufgrund von Qualitätsproblemen bei den Transkripten.
  • Verwendung eines angepassten Normalisierers auf Basis des englischen Whisper-Normalisierers, um künstlich erhöhte WER-Werte infolge von Formatierungsunterschieden statt tatsächlicher Transkriptionsfehler zu reduzieren.
  • Neue Gewichtung: 50% AA-AgentTalk, 25% Earnings22-Cleaned-AA, 25% VoxPopuli-Cleaned-AA.

AA-WER v1.0

September 2025–Februar 2026

  • Erste Veröffentlichung mit drei öffentlichen Datensätzen: AMI SDM, VoxPopuli und Earnings22.
  • ~6 Stunden Audio aus drei Datensätzen.