Methodik für Speech-to-Speech-Benchmarks
Überblick
Unser aktuelles Speech-to-Speech-Benchmarking bewertet native Audiomodelle – also Modelle, die native Audioeingaben und -ausgaben unterstützen – in zwei Qualitätsdimensionen: sprachbasiertes Schlussfolgern und Gesprächsdynamik.
Artificial Analysis Speech to Speech Index
Der Artificial Analysis Speech to Speech Index ist eine gewichtete Durchschnittspunktzahl für native Audiomodelle. Er kombiniert Ergebnisse aus sprachbasiertem Schlussfolgern, Gesprächsdynamik und agentischer Leistung. Modelle müssen für alle drei Datensätze gültige Ergebnisse aufweisen, um im Index zu erscheinen.
Die drei Datensätze werden derzeit gleich gewichtet: 33,3 % sprachbasiertes Schlussfolgern (Big Bench Audio), 33,3 % Gesprächsdynamik (Full Duplex Bench) und 33,3 % agentische Leistung (𝜏-Voice).
Sprachbasiertes Schlussfolgern
Überblick
Unser Benchmark für sprachbasiertes Schlussfolgern bewertet, wie gut native Audiomodelle Fragen beantworten können, die logisches Denken erfordern.
Native Audiomodelle erhalten eine Audioeingabedatei und sollen eine Audioausgabe erzeugen. Das Bewertungsmodell erhält die Antwort des getesteten Modells, die offizielle Antwort und die ursprüngliche Frage als Kontext und soll die Antwort des getesteten Modells als richtig oder falsch einstufen.
Datensatz: Big Bench Audio
Das Aufkommen nativer Audio-zu-Audio-Modelle eröffnet spannende Möglichkeiten, die Fähigkeiten von Sprachagenten zu erweitern und Arbeitsabläufe zu vereinfachen. Entscheidend ist jedoch, zu bewerten, ob diese Vereinfachung zulasten der Modellleistung geht oder andere Zielkonflikte mit sich bringt.
Um diese Frage beantworten zu können, haben wir Big Bench Audio veröffentlicht, einen neuen Datensatz zur Bewertung der Leistung nativer Audiomodelle.
Big Bench Audio enthält 1.000 Audiodateien mit Fragen, die die Intelligenz von Modellen testen sollen. Die Fragen basieren auf vier Kategorien des Big-Bench-Hard-Datensatzes (je 250 Fragen) und wurden mit 23 synthetischen Stimmen aus führenden Text-to-Speech-Modellen der Artificial Analysis Text to Speech Arena erzeugt.
Fragekategorien
Formale Fehlschlüsse (250 Fragen): Ermitteln, ob sich ein informell dargestelltes Argument logisch aus dem gegebenen Kontext ableiten lässt.
Beispiel: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?
Navigation (250 Fragen): Ermitteln, ob eine Folge von Navigationsschritten den Agenten zum Ausgangspunkt zurückführt.
Beispiel: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.
Objekte zählen (250 Fragen): Die Anzahl der Objekte einer bestimmten Kategorie in einer Sammlung von Besitztümern zählen.
Beispiel: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?
Netz aus Lügen (250 Fragen): Den Wahrheitswert einer booleschen Funktion bestimmen, die als Textaufgabe in natürlicher Sprache formuliert ist.
Beispiel: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?
Um die mit nativen Speech-to-Speech-Modellen verbundenen Zielkonflikte bewerten zu können, testen wir mehrere unterschiedliche Konfigurationen mit Big Bench Audio. Weitere Informationen zu Big Bench Audio finden Sie im Artikel; alternativ können Sie den Datensatz selbst herunterladen.
Gesprächsdynamik
Überblick
Unser Benchmark zur Gesprächsdynamik bewertet, wie gut native Audiomodelle realistische Gesprächsverhaltensweisen bewältigen – also Interaktionen, die in menschlichen Gesprächen ganz natürlich auftreten, für Sprachmodelle jedoch schwierig korrekt zu handhaben sind.
Dieser Benchmark wurde von Artificial Analysis auf Grundlage einer Teilmenge von Full Duplex Bench v1 (Lin et al., 2025) und Full Duplex Bench v1.5 (Lin et al., 2025) implementiert. Diese Benchmarks bewerten systematisch zentrale interaktive Verhaltensweisen von Full-Duplex-Sprachdialogmodellen.
Metriken
Aus Full Duplex Bench v1:
- Umgang mit Pausen: Prozentsatz der Stichproben, bei denen das Modell eine natürliche Pause des Nutzers richtigerweise nicht unterbricht. Bewertet, ob das Modell erkennt, dass die sprechende Person noch am Zug ist.
- Sprecherwechsel: Prozentsatz der Stichproben, bei denen das Modell zum richtigen Zeitpunkt den Gesprächsbeitrag übernimmt. Misst, wie gut das Modell das Ende eines Gesprächsbeitrags erkennt und zeitnah antwortet.
Aus Full Duplex Bench v1.5:
- Umgang mit Unterbrechungen durch Nutzer: Prozentsatz der Stichproben, bei denen das Modell angemessen auf eine Unterbrechung durch den Nutzer eingeht und auf Fragen oder Themenwechsel reagiert, die mitten im Gespräch aufkommen.
- Umgang mit Hörersignalen: Prozentsatz der Stichproben, bei denen das Modell seine Antwort richtigerweise fortsetzt, wenn ein Hörersignal wie „yeah“, „alright“ oder „mm-hmm“ eingespielt wird, statt es als neuen Gesprächsbeitrag zu behandeln.
Agentische Leistung (𝜏-Voice)
Überblick
Unser Benchmark für agentische Leistung bewertet, wie gut Speech-to-Speech-Modelle realistische Kundenserviceaufgaben durchgängig abschließen. Er misst die Befolgung mehrstufiger Anweisungen über mehrere Gesprächsrunden hinweg, die Fähigkeit, einen simulierten Kunden durch eine vollständige Interaktion zu begleiten, und den erfolgreichen Einsatz von Werkzeugen in simulierten Kundenservicesystemen.
Dieser Benchmark wurde von Artificial Analysis auf Grundlage von 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026) implementiert, einem Benchmark von Sierra, der Full-Duplex-Sprachagenten anhand realitätsnaher Kundenserviceaufgaben aus verschiedenen Bereichen bewertet.
Metrik
- Aufgabenerfüllung (pass@1): Anteil der Szenarien, in denen das Modell das Anliegen des Kunden korrekt löst. Jede Punktzahl ist der Mittelwert aus drei unabhängigen Durchläufen. Das getestete Modell wird als Kundenserviceagent mit Zugriff auf bereichsspezifische Werkzeuge und ein Richtliniendokument instruiert. Jedes Szenario hat genau einen gültigen Endzustand der Datenbank; bei der Bewertung wird der finale Zustand mit dieser Ground Truth verglichen.
Wir bewerten den Basisaufgabensatz in drei Bereichen:
- Fluggesellschaften (50 Szenarien): z. B. einen Flug ändern oder unter Richtlinienvorgaben umbuchen
- Einzelhandel (114 Szenarien): z. B. eine Abbuchung anfechten oder eine Rückgabe bearbeiten
- Telekommunikation (114 Szenarien): z. B. ein Abrechnungsproblem lösen oder eine Dienststörung beheben
Stimm-Personas
Die Kundenstimmen werden mit ElevenLabs anhand von Prompts erzeugt, die aus der öffentlich verfügbaren 𝜏-Voice-Implementierung von Sierra übernommen wurden. Wir verwenden zwei Kontroll-Personas, die Personen mit amerikanischem Standardenglisch repräsentieren, sowie fünf reguläre Personas mit unterschiedlichen Akzenten und Sprecherprofilen.
Kontrolle
Matt Delaney: Weißer Mann mittleren Alters aus dem Mittleren Westen der USA, ruhig und respektvoll.
Prompt: You are a middle-aged white man from the American Midwest. You always behave as if you are speaking out loud in a real-time conversation with a customer service agent. You are calm, clear, and respectful but also human. You sound like someone who's trying to be helpful and polite, even when you're slightly frustrated or in a hurry. You value efficiency but never sound robotic. You sometimes use contractions, informal phrasing, or small filler phrases ("yeah," "okay," "honestly," "no worries") to keep things natural. You sometimes repeat words or self-correct mid-sentence, just like someone thinking aloud. You sometimes ask polite clarifying questions or offer context ("I tried this earlier," "I'm not sure if that helps"). You rarely use formal, business-like or stiff language ("considerable," "retrieve," "representative"). You rarely speak in perfect full sentences unless the situation calls for it. Instead, you speak like a real person having a practical, respectful conversation.
Lisa Brenner: Weiße Frau Ende 40 aus einem Vorort, angespannt und ungeduldig.
Prompt: You are a white woman in your late 40s from a suburban area. You always speak as if you are talking out loud to a customer service agent who is already wasting your time. You're not openly hostile (yet), but you are tense, impatient, and clearly annoyed. You act like this issue should have been resolved the first time, and the fact that you're following up is unacceptable. You often sound clipped, exasperated, or sarcastically polite. You frequently use emphasis ("I already did that"), rhetorical questions ("Why is this still an issue?"), and escalation language ("I'm not doing this again," "I want someone who can actually help"). You expect fast results and get irritated when things are repeated. You often mention how long you've been waiting or how many times you've called. You sometimes threaten escalation but without yelling. You never sound relaxed. You never use slow, reflective speech. You never thank the agent unless something gets resolved.
Regulär
Mildred Kaplan: Weiße Frau Anfang 80, die Hilfe mit Technik benötigt.
Prompt: You are an elderly white woman in your early 80s calling customer service for help with something your grandson or neighbor usually does.
Arjun Roy: Bengalischer Mann Mitte 30 aus Dhaka, ruhig und direkt, mit starkem bengalischem Akzent.
Prompt: A Bengali man from Dhaka, Bangladesh in his mid-30s calling customer service about a billing issue. His English carries a strong Bengali accent with soft consonants and soft d and r sounds. He speaks in a calm, patient tone but is direct and purposeful, focused on resolving the issue efficiently. His pacing is slow, distracted with a warm yet firm timbre. The speech sounds like it is coming from far away.
Wei Lin: Chinesische Frau Ende 20 aus Sichuan, lebhaft und sachlich, mit starkem Sichuan-Mandarin-Akzent.
Prompt: A Chinese woman in her late 20s from Sichuan, calling customer service about a credit card billing issue. She speaks English with a thick Sichuan Mandarin accent. She sounds upbeat, matter-of-fact, and distracted. Her tone is firm but polite, with fast pacing and smooth timbre. Ok audio quality.
Mamadou Diallo: Senegalesischer Mann Mitte 30, in Eile, mit starkem französischem Akzent.
Prompt: A Senegalese man whose first language is French, in his mid-30s, calling customer service about a billing issue. He speaks English with a strong French accent. His tone is hurried, slightly annoyed, and matter-of-fact, as if he's been transferred between agents and just wants the problem fixed.
Priya Patil: Maharashtrische Frau Anfang 30, konzentriert und direkt, mit starkem maharashtrischem Akzent.
Prompt: A woman in her early 30s from Maharashtra, India, calling customer support from her mobile phone. She speaks Indian English with a strong Maharashtrian accent with noticeable regional intonation and rhythm. Her tone is slightly annoyed and hurried, matter-of-fact, and focused on getting the issue resolved quickly. Her voice has medium pitch, firm delivery, short sentences, and faint background room tone typical of a phone call.
Preis
- Preis pro Stunde Audioeingabe: Gesamtkosten (USD) für das Audio in der an die API gesendeten Anfrage bzw. Nachricht.
- Preis pro Stunde Audioausgabe: Gesamtkosten (USD) für das vom Modell erzeugte Audio, das von der API empfangen wird.
Geschwindigkeit
- Time to First Audio (TTFA): Durchschnittliche Anzahl an Sekunden bis zur Erzeugung des ersten Tokens der Audioausgabe, gemessen über den Fragensatz von Big Bench Audio. TTFA ist ein wichtiger Indikator für die wahrgenommene Reaktionsfähigkeit von Sprachagentenanwendungen.
Versionsverlauf
Artificial Analysis Speech to Speech Index v1.0
Juni 2026–heute
- Einführung des Artificial Analysis Speech to Speech Index, einer gewichteten Durchschnittspunktzahl, die Ergebnisse für sprachbasiertes Schlussfolgern, Gesprächsdynamik und agentische Leistung voraussetzt.
- Gleichgewichtung der drei Datensätze: 33,3 % sprachbasiertes Schlussfolgern (Big Bench Audio), 33,3 % Gesprächsdynamik (Full Duplex Bench) und 33,3 % agentische Leistung (𝜏-Voice).
Big Bench Audio (BBA) v1.2
Mai 2026–heute
- Aktualisierung des Bewertungsmodells und der Bewertungspipeline, um korrekte Endergebnisse in ausführlichen Antworten zuverlässiger zu erkennen. Dies schließt Fälle ein, in denen das Modell falsche Alternativen erörtert, bevor es die richtige Antwort gibt.
Big Bench Audio (BBA) v1.1
März 2026–Mai 2026
- Die Genauigkeit wurde als Anzahl der richtigen Antworten von 1.000 gemessen, einschließlich der Fragen, die das Modell nicht beantwortete.
- Claude Sonnet 4.6 wurde als Bewertungsmodell verwendet.
Big Bench Audio (BBA) v1.0
Dezember 2024–März 2026
- Die Genauigkeit wurde als Anteil der fehlerfreien Antworten gemessen, die korrekt beantwortet wurden. Modelle wurden somit nicht für Fragen abgestraft, die sie nicht beantworteten.
- Claude Sonnet 3.5 wurde als Bewertungsmodell verwendet.