Methodik für Speech-to-Speech-Benchmarks

Überblick

Unser aktuelles Speech-to-Speech-Benchmarking bewertet native Audiomodelle – also Modelle, die native Audioeingaben und -ausgaben unterstützen – in zwei Qualitätsdimensionen: sprachbasiertes Schlussfolgern und Gesprächsdynamik.

Artificial Analysis Speech to Speech Index

Der Artificial Analysis Speech to Speech Index ist eine gleichgewichtete Punktzahl für native Audiomodelle. Er kombiniert Ergebnisse aus sprachbasiertem Schlussfolgern, agentischer Leistung, Arena-Präferenz und der Aufgaben-Erfolgsquote. Modelle müssen für alle vier Komponenten gültige Ergebnisse aufweisen, um im Index zu erscheinen.

Die aktuelle Gewichtung ist über alle vier Komponenten gleich: 25 % sprachbasiertes Schlussfolgern (Big Bench Audio), 25 % agentische Leistung (𝜏-Voice), 25 % Arena-Präferenz (Arena Score) und 25 % Aufgaben-Erfolgsquote.

Sprachbasiertes Schlussfolgern

Überblick

Unser Benchmark für sprachbasiertes Schlussfolgern bewertet, wie gut native Audiomodelle Fragen beantworten können, die logisches Denken erfordern.

Native Audiomodelle erhalten eine Audioeingabedatei und sollen eine Audioausgabe erzeugen. Das Bewertungsmodell erhält die Antwort des getesteten Modells, die offizielle Antwort und die ursprüngliche Frage als Kontext und soll die Antwort des getesteten Modells als richtig oder falsch einstufen.

Datensatz: Big Bench Audio

Das Aufkommen nativer Audio-zu-Audio-Modelle eröffnet spannende Möglichkeiten, die Fähigkeiten von Sprachagenten zu erweitern und Arbeitsabläufe zu vereinfachen. Entscheidend ist jedoch, zu bewerten, ob diese Vereinfachung zulasten der Modellleistung geht oder andere Zielkonflikte mit sich bringt.

Um diese Frage beantworten zu können, haben wir Big Bench Audio veröffentlicht, einen neuen Datensatz zur Bewertung der Leistung nativer Audiomodelle.

Big Bench Audio enthält 1.000 Audiodateien mit Fragen, die die Intelligenz von Modellen testen sollen. Die Fragen basieren auf vier Kategorien des Big-Bench-Hard-Datensatzes (je 250 Fragen) und wurden mit 23 synthetischen Stimmen aus führenden Text-to-Speech-Modellen der Artificial Analysis Text to Speech Arena erzeugt.

Fragekategorien

Formale Fehlschlüsse (250 Fragen): Ermitteln, ob sich ein informell dargestelltes Argument logisch aus dem gegebenen Kontext ableiten lässt.

Beispiel: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?

Navigation (250 Fragen): Ermitteln, ob eine Folge von Navigationsschritten den Agenten zum Ausgangspunkt zurückführt.

Beispiel: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.

Objekte zählen (250 Fragen): Die Anzahl der Objekte einer bestimmten Kategorie in einer Sammlung von Besitztümern zählen.

Beispiel: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?

Netz aus Lügen (250 Fragen): Den Wahrheitswert einer booleschen Funktion bestimmen, die als Textaufgabe in natürlicher Sprache formuliert ist.

Beispiel: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?

Um die mit nativen Speech-to-Speech-Modellen verbundenen Zielkonflikte bewerten zu können, testen wir mehrere unterschiedliche Konfigurationen mit Big Bench Audio. Weitere Informationen zu Big Bench Audio finden Sie im Artikel; alternativ können Sie den Datensatz selbst herunterladen.

Gesprächsdynamik

Überblick

Unser Benchmark zur Gesprächsdynamik bewertet, wie gut native Audiomodelle realistische Gesprächsverhaltensweisen bewältigen – also Interaktionen, die in menschlichen Gesprächen ganz natürlich auftreten, für Sprachmodelle jedoch schwierig korrekt zu handhaben sind.

Dieser Benchmark wurde von Artificial Analysis auf Grundlage einer Teilmenge von Full Duplex Bench v1 (Lin et al., 2025) und Full Duplex Bench v1.5 (Lin et al., 2025) implementiert. Diese Benchmarks bewerten systematisch zentrale interaktive Verhaltensweisen von Full-Duplex-Sprachdialogmodellen.

Metriken

Aus Full Duplex Bench v1:

  • Umgang mit Pausen: Prozentsatz der Stichproben, bei denen das Modell eine natürliche Pause des Nutzers richtigerweise nicht unterbricht. Bewertet, ob das Modell erkennt, dass die sprechende Person noch am Zug ist.
  • Sprecherwechsel: Prozentsatz der Stichproben, bei denen das Modell zum richtigen Zeitpunkt den Gesprächsbeitrag übernimmt. Misst, wie gut das Modell das Ende eines Gesprächsbeitrags erkennt und zeitnah antwortet.

Aus Full Duplex Bench v1.5:

  • Umgang mit Unterbrechungen durch Nutzer: Prozentsatz der Stichproben, bei denen das Modell angemessen auf eine Unterbrechung durch den Nutzer eingeht und auf Fragen oder Themenwechsel reagiert, die mitten im Gespräch aufkommen.
  • Umgang mit Hörersignalen: Prozentsatz der Stichproben, bei denen das Modell seine Antwort richtigerweise fortsetzt, wenn ein Hörersignal wie „yeah“, „alright“ oder „mm-hmm“ eingespielt wird, statt es als neuen Gesprächsbeitrag zu behandeln.

Agentische Leistung (𝜏-Voice)

Überblick

Unser Benchmark für agentische Leistung bewertet, wie gut Speech-to-Speech-Modelle realistische Kundenserviceaufgaben durchgängig abschließen. Er misst die Befolgung mehrstufiger Anweisungen über mehrere Gesprächsrunden hinweg, die Fähigkeit, einen simulierten Kunden durch eine vollständige Interaktion zu begleiten, und den erfolgreichen Einsatz von Werkzeugen in simulierten Kundenservicesystemen.

Dieser Benchmark wurde von Artificial Analysis auf Grundlage von 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026) implementiert, einem Benchmark von Sierra, der Full-Duplex-Sprachagenten anhand realitätsnaher Kundenserviceaufgaben aus verschiedenen Bereichen bewertet.

Metrik

  • Aufgabenerfüllung (pass@1): Anteil der Szenarien, in denen das Modell das Anliegen des Kunden korrekt löst. Jede Punktzahl ist der Mittelwert aus drei unabhängigen Durchläufen. Das getestete Modell wird als Kundenserviceagent mit Zugriff auf bereichsspezifische Werkzeuge und ein Richtliniendokument instruiert. Jedes Szenario hat genau einen gültigen Endzustand der Datenbank; bei der Bewertung wird der finale Zustand mit dieser Ground Truth verglichen.

Wir bewerten den Basisaufgabensatz in drei Bereichen:

  • Fluggesellschaften (50 Szenarien): z. B. einen Flug ändern oder unter Richtlinienvorgaben umbuchen
  • Einzelhandel (114 Szenarien): z. B. eine Abbuchung anfechten oder eine Rückgabe bearbeiten
  • Telekommunikation (114 Szenarien): z. B. ein Abrechnungsproblem lösen oder eine Dienststörung beheben

Stimm-Personas

Die Kundenstimmen werden mit ElevenLabs anhand von Prompts erzeugt, die aus der öffentlich verfügbaren 𝜏-Voice-Implementierung von Sierra übernommen wurden. Wir verwenden zwei Kontroll-Personas, die Personen mit amerikanischem Standardenglisch repräsentieren, sowie fünf reguläre Personas mit unterschiedlichen Akzenten und Sprecherprofilen.

Speech Agent Arena

Überblick

Die Speech Agent Arena ist ein verblindeter Präferenz-Benchmark, der bewertet, welches native Audiomodell die Teilnehmenden in Live-Sprachgesprächen bevorzugen. Sie ergänzt unsere automatisierten Benchmarks, indem sie das gesamte Gesprächserlebnis bei realistischen Aufgaben mit menschlichen Teilnehmenden misst.

In jeder Runde erhält eine teilnehmende Person ein Szenario, bearbeitet es separat mit zwei Modellen, deren Identität verborgen bleibt, und muss nach beiden Anrufen eine Gesamtpräferenz angeben. Die Teilnehmenden beantworten außerdem diagnostische Fragen, die wir getrennt von der Gesamtpräferenz erfassen.

Metriken

  • Präferenz-Elo: Die Präferenz-Elo wird für alle Szenarien, agentische Szenarien und nicht-agentische Szenarien jeweils separat mit der Bradley–Terry-Maximum-Likelihood-Methode berechnet. Die approximativen 95%-Konfidenzintervalle verwenden dieselbe auf der Hesse-Matrix basierende Methode wie die TTS Arena. GPT Realtime 1.5 verankert die Skala bei 1000 Elo.
  • Aufgaben-Erfolgsquote: Die Aufgaben-Erfolgsquote ist der Prozentsatz der auswertbaren Gespräche, in denen das Modell den korrekten abschließenden Tool-Aufruf oder die korrekten abschließenden Tool-Aufrufe zur Aufgabenerfüllung ausgeführt hat. Auswertbare Gespräche entsprechen der Summe aus Erfolgen und Modellfehlern; Abweichungen der Teilnehmenden und nicht überprüfbare Fälle werden vor der Berechnung ausgeschlossen.

Datensatz / Evaluationsaufbau

Die Arena umfasst 35 Szenarien: 15 agentische Szenarien mit Tool-Aufrufen und 20 nicht-agentische Szenarien ohne Tools.

  • Agentisch (15 Szenarien): Die Modelle erhalten Tools, die für die Erledigung der zugewiesenen Aufgabe relevant sind.

    Beispiele:

    • Buche eine zahnärztliche Kontrolluntersuchung für einen Neupatienten am Dienstag um 9:30 Uhr oder zum frühesten verfügbaren Termin am Vormittag, falls diese Uhrzeit bereits belegt ist.
    • Bestelle zwei verschiedene Pizzen und eine Beilage zur Lieferung. Der Gesamtpreis einschließlich Lieferung muss unter 45 US-Dollar bleiben.
  • Nicht-agentisch (20 Szenarien): Die Modelle führen das Gespräch ohne Tools anhand der Informationen im System-Prompt.

    Beispiele:

    • Frage nach den Öffnungszeiten des Schwimmbads am Sonntag, den Preisen für Familieneintrittskarten und der Verfügbarkeit von Handtüchern.
    • Frage nach Yoga-Anfängerkursen, Kurs- und Mitgliedschaftspreisen und danach, was mitzubringen ist.

In der Übersicht zur Speech Agent Arena findest du eine beispielhaft durchgespielte Arena-Runde, Modelleingaben, Tool-Schemas und Beispielgespräche.

Aufgaben-Erfolgsquote

Schritt 1: Eignung des Teilnehmerverhaltens für die Auswertung. Judge 1 erhält das zugewiesene Szenario, das Transkript und die Definitionen der erforderlichen abschließenden Aufrufe. Er prüft, ob die teilnehmende Person die zugewiesene Aufgabe versucht hat, inhaltlich im Wesentlichen bei ihr geblieben ist, einen auswertbaren abschließenden Wunsch geäußert oder ein auswertbares Ergebnis akzeptiert hat und dem Modell eine angemessene Gelegenheit zum Handeln gegeben hat. Nur auswertbare Gespräche gehen in Schritt 2 ein.

Schritt 2a: Erforderliche abschließende Aufrufe. Für auswertbare Gespräche erhält Judge 2 die erforderlichen abschließenden Aufrufe und das vollständige chronologische Protokoll der Tool-Aufrufe. Er prüft, ob alle erforderlichen abschließenden Aufrufe mit dem richtigen Tool und der richtigen Aufrufanzahl ausgeführt wurden, ohne unbeabsichtigte abschließende Aktionen. Unterstützende Aufrufe und end_call werden nicht als Aufgabenerfüllung gewertet.

Schritt 2b: Argumente der abschließenden Aufrufe. Dieselbe Bewertung durch Judge 2 prüft, ob alle vom Schema geforderten Argumente angegeben wurden und mit dem letzten mündlich geäußerten Wunsch der teilnehmenden Person und dem Gesprächskontext übereinstimmen. Operativ gleichwertige Formulierungen und unschädliche Transkriptionsabweichungen sind zulässig. Ein fehlgeschlagener Versuch, der anschließend korrigiert wird, kann bestehen; fehlende Aufrufe, falsche Argumente oder zusätzliche abschließende Aktionen führen zum Nichtbestehen.

Veröffentlichungsregeln

  • Gesamtergebnisse werden für Modelle mit mindestens 100 Teilnahmen und einer Halbbreite des 95%-Konfidenzintervalls von höchstens 75 veröffentlicht.
  • Aufnahmen und Transkripte der Teilnehmenden werden nicht veröffentlicht. Beispiele werden erst gezeigt, wenn die Einwilligung zur Aufnahme bestätigt wurde und etwaige personenbezogene Informationen geprüft und unkenntlich gemacht wurden.

Wir geben für die Aufgaben-Erfolgsquote jedes Modells ein 95%-Konfidenzintervall nach Wilson an. Abweichungen der Teilnehmenden und nicht überprüfbare Gespräche werden vor der Berechnung ausgeschlossen.

Einbindung in den Speech to Speech Index

Ausschließlich zur Verwendung im Artificial Analysis Speech to Speech Index:

Arena Score: Arena Score wandelt das Elo eines Modells in die erwartete Präferenz gegenüber einer Basislinie von 800 Elo um. Verwendet wird ein Elo, das zum Zeitpunkt der Veröffentlichungsfähigkeit des Modells eingefroren wurde.

Arena Score = 100 / (1 + 10^((800 − frozen Elo) / 400))

Preis

  • Preis pro Stunde Audioeingabe: Gesamtkosten (USD) für das Audio in der an die API gesendeten Anfrage bzw. Nachricht.
  • Preis pro Stunde Audioausgabe: Gesamtkosten (USD) für das vom Modell erzeugte Audio, das von der API empfangen wird.

Geschwindigkeit

  • Time to First Audio (TTFA): Durchschnittliche Anzahl an Sekunden bis zur Erzeugung des ersten Tokens der Audioausgabe, gemessen über den Fragensatz von Big Bench Audio. TTFA ist ein wichtiger Indikator für die wahrgenommene Reaktionsfähigkeit von Sprachagentenanwendungen.

Versionsverlauf

Artificial Analysis Speech to Speech Index v2.0

August 2026–heute

  • Gesprächsdynamik (Full Duplex Bench) wurde durch die Aufgaben-Erfolgsquote im Index ersetzt.
  • Gleichgewichtung über vier Komponenten: 25 % sprachbasiertes Schlussfolgern (Big Bench Audio), 25 % agentische Leistung (𝜏-Voice), 25 % Arena-Präferenz (Arena Score) und 25 % Aufgaben-Erfolgsquote.

Artificial Analysis Speech to Speech Index v1.1

August 2026

  • Speech Agent Arena wurde zum Artificial Analysis Speech to Speech Index hinzugefügt.
  • Gleichgewichtung über vier Datensätze: 25 % sprachbasiertes Schlussfolgern (Big Bench Audio), 25 % Gesprächsdynamik (Full Duplex Bench), 25 % agentische Leistung (𝜏-Voice) und 25 % Speech Agent Arena.

Artificial Analysis Speech to Speech Index v1.0

Juni 2026–heute

  • Einführung des Artificial Analysis Speech to Speech Index, einer gewichteten Durchschnittspunktzahl, die Ergebnisse für sprachbasiertes Schlussfolgern, Gesprächsdynamik und agentische Leistung voraussetzt.
  • Gleichgewichtung der drei Datensätze: 33,3 % sprachbasiertes Schlussfolgern (Big Bench Audio), 33,3 % Gesprächsdynamik (Full Duplex Bench) und 33,3 % agentische Leistung (𝜏-Voice).

Big Bench Audio (BBA) v1.2

Mai 2026–heute

  • Aktualisierung des Bewertungsmodells und der Bewertungspipeline, um korrekte Endergebnisse in ausführlichen Antworten zuverlässiger zu erkennen. Dies schließt Fälle ein, in denen das Modell falsche Alternativen erörtert, bevor es die richtige Antwort gibt.

Big Bench Audio (BBA) v1.1

März 2026–Mai 2026

  • Die Genauigkeit wurde als Anzahl der richtigen Antworten von 1.000 gemessen, einschließlich der Fragen, die das Modell nicht beantwortete.
  • Claude Sonnet 4.6 wurde als Bewertungsmodell verwendet.

Big Bench Audio (BBA) v1.0

Dezember 2024–März 2026

  • Die Genauigkeit wurde als Anteil der fehlerfreien Antworten gemessen, die korrekt beantwortet wurden. Modelle wurden somit nicht für Fragen abgestraft, die sie nicht beantworteten.
  • Claude Sonnet 3.5 wurde als Bewertungsmodell verwendet.