Bestenliste für Speech-to-Speech-KI-Modelle und -Anbieter
Analyse und Vergleich von Speech-to-Speech-Modellen und API-Anbietern. Artificial Analysis hat Speech-to-Speech-Modelle und Hosting-Anbieter anhand verschiedener Merkmale analysiert, darunter Qualität des Schlussfolgerns, Gesprächsdynamik, Generierungszeit und Preis.
Weitere Details findest du auf der Methodikseite.
Artificial Analysis Speech to Speech Index
Artificial Analysis Speech to Speech Index
Sprachbasiertes Schlussfolgern
Sprachbasiertes Schlussfolgern (Big Bench Audio)
Agentische Leistung
Agentische Leistung (𝜏-Voice)
Hinweis: Folgende Modelle basieren auf 1 Durchlauf: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Folgende Modelle basieren auf 2 Durchläufen: GPT-Realtime-2.1 High, OpenAI
Agentische Leistung (𝜏-Voice) nach Domäne
Hinweis: Folgende Modelle basieren auf 1 Durchlauf: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Folgende Modelle basieren auf 2 Durchläufen: GPT-Realtime-2.1 High, OpenAI
Speech Agent Arena
Arena-Präferenz-Elo
Aufgaben-Erfolgsquote
Gesprächsdynamik
Gesprächsdynamik (Teilmenge von Full Duplex Bench)
Gesprächsdynamik (Teilmenge von Full Duplex Bench) – Aufschlüsselung nach Kategorie
API-Benchmarks
Kosten pro Stunde Audioeingabe (Teilmenge von Big Bench Audio)
Sprachbasiertes Schlussfolgern (Big Bench Audio) vs. Kosten pro Stunde Audioeingabe
Time to First Audio
Sprachbasiertes Schlussfolgern (Big Bench Audio) vs. Geschwindigkeit
Zusammenfassung wichtiger Kennzahlen & weitere Informationen
Qwen Audio 3.0 Realtime Plus | 69,5 | 99 % | 98,4 % | 54,6 % | 775 | 77,8 % | 1,54 | 4,42 | 0,03 | 0,18 | |
Qwen3.5 Omni Plus Realtime | - | 99 % | - | - | 859 | 62,0 % | 2,64 | 0,00 | 0,16 | 0,82 | |
Qwen Audio 3.0 Realtime Flash | 67,7 | 96 % | 96,9 % | 35,9 % | 850 | 81,7 % | 1,55 | 4,77 | - | - | |
Qwen3.5 Omni Flash Realtime | - | 59 % | - | - | 841 | 29,1 % | 0,79 | 0,00 | 0,16 | 0,82 | |
Qwen3 Omni Flash | - | 59 % | 72,7 % | - | - | - | 4,82 | 1,77 | 0,61 | 1,36 | |
Qwen3 Omni Realtime | - | 57 % | - | - | - | - | 0,88 | 2,26 | 0,65 | 0,99 | |
Nova 2.0 Sonic (Mar 2026) | - | 88 % | - | - | 974 | 57,1 % | 1,14 | 4,89 | 0,27 | 1,08 | |
Higgs Realtime | - | 69 % | 92,8 % | 18,6 % | - | - | 1,47 | - | - | - | |
FLM-Audio | - | 16 % | 62,0 % | - | - | - | - | - | - | - | |
Deepslate Opal | - | 85 % | 85,7 % | 17,5 % | - | - | 0,44 | 6,48 | - | - | |
Gemini 3.8 Live Extended Thinking (High) | 82,6 | 98 % | 91,9 % | 68,6 % | 990 | 89,1 % | 1,35 | 3,50 | - | - | |
Gemini 3.1 Flash Live High | 72,0 | 97 % | 74,3 % | 37,7 % | 1063 | 71,8 % | 2,99 | 1,75 | 0,35 | 1,38 | |
Gemini 3.8 Live | 76,0 | 92 % | 96,1 % | 30,1 % | 1083 | 93,2 % | 1,18 | 0,84 | - | - | |
Gemini 2.5 Flash Native Audio Dialog Thinking | - | 91 % | - | - | - | - | 3,87 | - | 0,35 | 1,38 | |
Gemini 3.1 Flash Live Minimal | 64,2 | 71 % | 72,3 % | 26,2 % | 1096 | 74,6 % | 0,96 | 1,50 | 0,35 | 1,38 | |
Gemini 2.5 Flash Native Audio Dialog | - | 69 % | - | - | - | - | 0,63 | 1,42 | 0,35 | 1,38 | |
Gemini 2.5 Flash Native Audio Preview (Dec 2025) | - | - | 44,0 % | 22,8 % | - | - | - | - | - | - | |
Gemini 2.5 Flash Native Audio Preview (Sep 2025) | - | - | 30,3 % | - | - | - | - | - | - | - | |
Raon SpeechChat | - | 58 % | 86,2 % | - | - | - | 0,04 | - | - | - | |
Moshi | - | 4 % | 61,0 % | - | - | - | - | - | - | - | |
Nemotron Voicechat | - | 27 % | 52,9 % | - | - | - | - | - | - | - | |
PersonaPlex | - | 19 % | 91,0 % | - | - | - | - | - | - | - | |
GPT-Realtime-2 (High) | 73,6 | 97 % | 95,3 % | 39,8 % | 932 | 89,8 % | 1,14 | 4,14 | 1,15 | 4,61 | |
GPT-Realtime-2.1 High | 75,2 | 96 % | 95,7 % | 45,7 % | 928 | 91,5 % | 1,21 | 10,75 | - | - | |
GPT-Realtime-2 (Medium) | - | 93 % | 95,2 % | 37,4 % | - | - | 1,22 | 3,97 | 1,15 | 4,61 | |
GPT-Live-1 (Astra, medium) | 83,2 | 90 % | 94,9 % | 74,5 % | 1048 | 87,4 % | 1,34 | 5,83 | - | - | |
GPT-Live-1 (Sol, low) | 80,1 | 89 % | 97,3 % | 59,3 % | 1053 | 90,9 % | 1,24 | 4,47 | - | - | |
GPT-Realtime-2.1 Minimal | 70,7 | 87 % | 92,7 % | 38,0 % | 937 | 89,4 % | 0,97 | 11,31 | - | - | |
GPT Realtime (Aug '25) | 69,1 | 83 % | 93,9 % | 30,4 % | 974 | 89,4 % | 0,98 | 11,08 | 1,15 | 4,61 | |
GPT-Realtime-1.5 | 70,3 | 81 % | 95,7 % | 38,8 % | 1000 | 85,1 % | 0,81 | 11,44 | 1,15 | 4,61 | |
GPT-Realtime-2.1 Mini High | - | 75 % | 91,7 % | 29,4 % | - | - | 4,28 | 3,45 | - | - | |
GPT-Realtime-2 (Minimal) | 63,3 | 72 % | 96,1 % | 30,8 % | 916 | 84,7 % | 1,12 | 3,07 | 1,15 | 4,61 | |
GPT-4o mini Realtime (Dec 2024) | - | 69 % | - | - | - | - | 1,27 | 5,75 | 0,36 | 1,44 | |
GPT Realtime Mini (Oct '25) | 56,1 | 64 % | 95,7 % | 15,1 % | 917 | 79,6 % | 0,81 | 3,04 | 0,36 | 1,44 | |
GPT-Realtime-2.1 Mini Minimal | 54,4 | 63 % | 91,8 % | 22,5 % | 840 | 76,7 % | 0,85 | 4,60 | - | - | |
GPT-4o audio chatcompletions | - | 54 % | - | - | - | - | 3,38 | 0,00 | 3,60 | 14,40 | |
GPT-4o Realtime (Dec 2024) | - | - | 89,8 % | 27,9 % | - | - | 1,49 | 2,04 | 1,44 | 5,76 | |
Grok Voice Think Fast 2.0 High | 81,3 | 97 % | 95,1 % | 56,5 % | 1011 | 94,6 % | 0,70 | 4,80 | - | - | |
Grok Voice Think Fast 1.0 | 73,7 | 97 % | 77,8 % | 52,1 % | 908 | 80,7 % | 1,25 | 3,00 | - | - | |
Grok Voice Fast 1.0 | - | 93 % | 71,6 % | 27,4 % | - | - | 0,78 | 3,00 | 3,00 | 3,00 | |
StepAudio 3 Realtime | - | 100 % | 98,9 % | - | - | - | 8,83 | - | - | - | |
Step-Audio R1.1 (Realtime) | - | 98 % | - | - | - | - | 1,53 | 0,00 | 0,06 | 1,69 | |
Freeze-Omni | - | 33 % | 58,7 % | - | - | - | - | - | - | - |
Häufig gestellte Fragen
StepAudio 3 Realtime führt mit einem Score für sprachbasiertes Schlussfolgern von 99,7 % auf dem Datensatz Big Bench Audio unter 40 bewerteten Modellen. Es folgen Qwen Audio 3.0 Realtime Plus mit 99,2 % und Qwen3.5 Omni Plus Realtime mit 98,7 %.
StepAudio 3 Realtime führt mit einem Score für Gesprächsdynamik von 98,9 % auf dem Datensatz Full Duplex Bench unter 34 bewerteten Modellen. Es folgen Qwen Audio 3.0 Realtime Plus mit 98,4 % und GPT-Live-1 (Sol, low) mit 97,3 %.
Die besten Speech-to-Speech-Modelle nach Qualität des Schlussfolgerns sind: 1. StepAudio 3 Realtime (99,7 %), 2. Qwen Audio 3.0 Realtime Plus (99,2 %), 3. Qwen3.5 Omni Plus Realtime (98,7 %), 4. Gemini 3.8 Live Extended Thinking (High) (97,7 %) und 5. Step-Audio R1.1 (Realtime) (97,6 %). Die Scores basieren auf dem Benchmark Big Bench Audio.
Die besten Speech-to-Speech-Modelle nach Gesprächsdynamik sind: 1. StepAudio 3 Realtime (98,9 %), 2. Qwen Audio 3.0 Realtime Plus (98,4 %), 3. GPT-Live-1 (Sol, low) (97,3 %), 4. Qwen Audio 3.0 Realtime Flash (96,9 %) und 5. Gemini 3.8 Live (96,1 %). Die Scores basieren auf dem Benchmark Full Duplex Bench.
Raon SpeechChat hat mit 0,04 Sek. die niedrigste Time to First Audio, gefolgt von Deepslate Opal (0,44 Sek.) und Gemini 2.5 Flash Native Audio Dialog (0,63 Sek.). Niedrigere Werte bedeuten eine schnellere erste Antwort.
Qwen Audio 3.0 Realtime Plus ist mit 0,0331 $/Stunde Audioeingabe am günstigsten, gefolgt von Step-Audio R1.1 (Realtime) (0,064 $/Stunde) und Qwen3.5 Omni Plus Realtime (0,162 $/Stunde).
Full Duplex Bench bewertet, wie gut Speech-to-Speech-Modelle mit echtem Gesprächsverhalten umgehen: wissen, wann sie sprechen und wann sie in Pausen schweigen sollten, wie sie auf Unterbrechungen reagieren und wie sie Hörersignale wie „ja“ oder „mhm“ erkennen. Artificial Analysis implementiert eine Teilmenge von Full Duplex Bench v1 und v1.5.
Sprachbasiertes Schlussfolgern (Big Bench Audio) misst, ob ein Modell als Audio gestellte Denkaufgaben verstehen und korrekt beantworten kann. Gesprächsdynamik (Full Duplex Bench) misst, ob ein Modell einen natürlichen Gesprächsfluss bewältigen kann – Sprecherwechsel, Pausen und Unterbrechungen. Ein Modell kann in einem Bereich glänzen, im anderen aber nicht.
Echtzeitgespräche erfordern sowohl eine starke Gesprächsdynamik als auch eine niedrige Latenz. Beim Score für Gesprächsdynamik liegen StepAudio 3 Realtime (98,9 %), Qwen Audio 3.0 Realtime Plus (98,4 %) und GPT-Live-1 (Sol, low) (97,3 %) vorn. Bei der Time to First Audio sind Raon SpeechChat (0,04 Sek.), Deepslate Opal (0,44 Sek.) und Gemini 2.5 Flash Native Audio Dialog (0,63 Sek.) am schnellsten. Die beste Wahl hängt davon ab, ob für deinen Anwendungsfall ein natürlicher Gesprächsfluss oder die Antwortgeschwindigkeit wichtiger ist.
Die Benchmarks werden regelmäßig aktualisiert, sobald neue Modelle und Anbieter hinzukommen. Leistungskennzahlen werden kontinuierlich überwacht, um die aktuellen Fähigkeiten der Anbieter und Preisänderungen abzubilden.