Bestenliste für Speech-to-Speech-KI-Modelle und -Anbieter

Analyse und Vergleich von Speech-to-Speech-Modellen und API-Anbietern. Artificial Analysis hat Speech-to-Speech-Modelle und Hosting-Anbieter anhand verschiedener Merkmale analysiert, darunter Qualität des Schlussfolgerns, Gesprächsdynamik, Generierungszeit und Preis.

Weitere Details findest du auf der Methodikseite.

Weighted average of Speech Reasoning, Agentic Performance, Arena Preference, and Task Success Rate results · Higher is better
Time to first audio (seconds) on Big Bench Audio · Lower is better
Cost to complete fixed 40-question Big Bench Audio subset based on length of input audio, normalized to hourly basis · Lower is better

Artificial Analysis Speech to Speech Index

Artificial Analysis Speech to Speech Index

Weighted average of Speech Reasoning, Agentic Performance, Arena Preference, and Task Success Rate results · Only models with all data available shown · Higher is better

Sprachbasiertes Schlussfolgern

Sprachbasiertes Schlussfolgern (Big Bench Audio)

Speech reasoning: based on the Artificial Analysis Big Bench Audio dataset · Higher is better

Agentische Leistung

Agentische Leistung (𝜏-Voice)

Proportion of replica customer service scenarios resolved while acting as a customer support agent, based on the 𝜏-Voice benchmark · Higher is better · Only full duplex models

Hinweis: Folgende Modelle basieren auf 1 Durchlauf: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Folgende Modelle basieren auf 2 Durchläufen: GPT-Realtime-2.1 High, OpenAI

Agentische Leistung (𝜏-Voice) nach Domäne

Proportion of replica customer service scenarios resolved by domain, based on the 𝜏-Voice benchmark · Higher is better · Only full duplex models

Hinweis: Folgende Modelle basieren auf 1 Durchlauf: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Folgende Modelle basieren auf 2 Durchläufen: GPT-Realtime-2.1 High, OpenAI

Speech Agent Arena

Arena-Präferenz-Elo

Preference Elo measures human participants' overall preference after they complete the same scenario with two unidentified Speech to Speech models, such as booking a dental appointment · Only includes models with tool calling · Higher is better

Aufgaben-Erfolgsquote

Proportion of eligible conversations with the correct final task-completing tool call or calls · Higher is better

Gesprächsdynamik

Gesprächsdynamik (Teilmenge von Full Duplex Bench)

Weighted average of pause handling, turn-taking, interruption handling, and backchannel handling from Full Duplex Bench v1 and v1.5 · Higher is better

Gesprächsdynamik (Teilmenge von Full Duplex Bench) – Aufschlüsselung nach Kategorie

Einzelne Kategorie-Scores, sortiert nach dem Score für Gesprächsdynamik · Basierend auf einer Teilmenge von Full Duplex Bench v1 und v1.5

API-Benchmarks

Kosten pro Stunde Audioeingabe (Teilmenge von Big Bench Audio)

Cost to complete fixed 40-question Big Bench Audio subset based on length of input audio, normalized to hourly basis · Lower is better

Sprachbasiertes Schlussfolgern (Big Bench Audio) vs. Kosten pro Stunde Audioeingabe

Score in Big Bench Audio vs. Kosten pro Stunde Audioeingabe, gemessen an einer festen Teilmenge mit 40 Fragen · Höheres sprachbasiertes Schlussfolgern und niedrigere Kosten sind besser
Most attractive quadrant

Time to First Audio

Average time to first audio (seconds) on Big Bench Audio dataset · Lower is better

Sprachbasiertes Schlussfolgern (Big Bench Audio) vs. Geschwindigkeit

Score in Big Bench Audio vs. Time to First Audio · Höheres sprachbasiertes Schlussfolgern und niedrigere Latenz sind besser
Most attractive quadrant

Zusammenfassung wichtiger Kennzahlen & weitere Informationen

Logo von Alibaba CloudAlibaba Cloud
Qwen Audio 3.0 Realtime Plus
69,5
99 %
98,4 %
54,6 %
775
77,8 %
1,54
4,42
0,03
0,18
Logo von Alibaba CloudAlibaba Cloud
Qwen3.5 Omni Plus Realtime
-
99 %
-
-
859
62,0 %
2,64
0,00
0,16
0,82
Logo von Alibaba CloudAlibaba Cloud
Qwen Audio 3.0 Realtime Flash
67,7
96 %
96,9 %
35,9 %
850
81,7 %
1,55
4,77
-
-
Logo von Alibaba CloudAlibaba Cloud
Qwen3.5 Omni Flash Realtime
-
59 %
-
-
841
29,1 %
0,79
0,00
0,16
0,82
Logo von Alibaba CloudAlibaba Cloud
Qwen3 Omni Flash
-
59 %
72,7 %
-
-
-
4,82
1,77
0,61
1,36
Logo von Alibaba CloudAlibaba Cloud
Qwen3 Omni Realtime
-
57 %
-
-
-
-
0,88
2,26
0,65
0,99
Logo von Amazon BedrockAmazon Bedrock
Nova 2.0 Sonic (Mar 2026)
-
88 %
-
-
974
57,1 %
1,14
4,89
0,27
1,08
Logo von Boson AIBoson AI
Higgs Realtime
-
69 %
92,8 %
18,6 %
-
-
1,47
-
-
-
Logo von Cofe AICofe AI
FLM-Audio
-
16 %
62,0 %
-
-
-
-
-
-
-
Logo von DeepslateDeepslate
Deepslate Opal
-
85 %
85,7 %
17,5 %
-
-
0,44
6,48
-
-
Logo von GoogleGoogle
Gemini 3.8 Live Extended Thinking (High)
82,6
98 %
91,9 %
68,6 %
990
89,1 %
1,35
3,50
-
-
Logo von GoogleGoogle
Gemini 3.1 Flash Live High
72,0
97 %
74,3 %
37,7 %
1063
71,8 %
2,99
1,75
0,35
1,38
Logo von GoogleGoogle
Gemini 3.8 Live
76,0
92 %
96,1 %
30,1 %
1083
93,2 %
1,18
0,84
-
-
Logo von GoogleGoogle
Gemini 2.5 Flash Native Audio Dialog Thinking
-
91 %
-
-
-
-
3,87
-
0,35
1,38
Logo von GoogleGoogle
Gemini 3.1 Flash Live Minimal
64,2
71 %
72,3 %
26,2 %
1096
74,6 %
0,96
1,50
0,35
1,38
Logo von GoogleGoogle
Gemini 2.5 Flash Native Audio Dialog
-
69 %
-
-
-
-
0,63
1,42
0,35
1,38
Logo von GoogleGoogle
Gemini 2.5 Flash Native Audio Preview (Dec 2025)
-
-
44,0 %
22,8 %
-
-
-
-
-
-
Logo von GoogleGoogle
Gemini 2.5 Flash Native Audio Preview (Sep 2025)
-
-
30,3 %
-
-
-
-
-
-
-
Logo von KraftonKrafton
Raon SpeechChat
-
58 %
86,2 %
-
-
-
0,04
-
-
-
Logo von KyutaiKyutai
Moshi
-
4 %
61,0 %
-
-
-
-
-
-
-
Logo von NVIDIANVIDIA
Nemotron Voicechat
-
27 %
52,9 %
-
-
-
-
-
-
-
Logo von NVIDIANVIDIA
PersonaPlex
-
19 %
91,0 %
-
-
-
-
-
-
-
Logo von OpenAIOpenAI
GPT-Realtime-2 (High)
73,6
97 %
95,3 %
39,8 %
932
89,8 %
1,14
4,14
1,15
4,61
Logo von OpenAIOpenAI
GPT-Realtime-2.1 High
75,2
96 %
95,7 %
45,7 %
928
91,5 %
1,21
10,75
-
-
Logo von OpenAIOpenAI
GPT-Realtime-2 (Medium)
-
93 %
95,2 %
37,4 %
-
-
1,22
3,97
1,15
4,61
Logo von OpenAIOpenAI
GPT-Live-1 (Astra, medium)
83,2
90 %
94,9 %
74,5 %
1048
87,4 %
1,34
5,83
-
-
Logo von OpenAIOpenAI
GPT-Live-1 (Sol, low)
80,1
89 %
97,3 %
59,3 %
1053
90,9 %
1,24
4,47
-
-
Logo von OpenAIOpenAI
GPT-Realtime-2.1 Minimal
70,7
87 %
92,7 %
38,0 %
937
89,4 %
0,97
11,31
-
-
Logo von OpenAIOpenAI
GPT Realtime (Aug '25)
69,1
83 %
93,9 %
30,4 %
974
89,4 %
0,98
11,08
1,15
4,61
Logo von OpenAIOpenAI
GPT-Realtime-1.5
70,3
81 %
95,7 %
38,8 %
1000
85,1 %
0,81
11,44
1,15
4,61
Logo von OpenAIOpenAI
GPT-Realtime-2.1 Mini High
-
75 %
91,7 %
29,4 %
-
-
4,28
3,45
-
-
Logo von OpenAIOpenAI
GPT-Realtime-2 (Minimal)
63,3
72 %
96,1 %
30,8 %
916
84,7 %
1,12
3,07
1,15
4,61
Logo von OpenAIOpenAI
GPT-4o mini Realtime (Dec 2024)
-
69 %
-
-
-
-
1,27
5,75
0,36
1,44
Logo von OpenAIOpenAI
GPT Realtime Mini (Oct '25)
56,1
64 %
95,7 %
15,1 %
917
79,6 %
0,81
3,04
0,36
1,44
Logo von OpenAIOpenAI
GPT-Realtime-2.1 Mini Minimal
54,4
63 %
91,8 %
22,5 %
840
76,7 %
0,85
4,60
-
-
Logo von OpenAIOpenAI
GPT-4o audio chatcompletions
-
54 %
-
-
-
-
3,38
0,00
3,60
14,40
Logo von OpenAIOpenAI
GPT-4o Realtime (Dec 2024)
-
-
89,8 %
27,9 %
-
-
1,49
2,04
1,44
5,76
Logo von SpaceXAISpaceXAI
Grok Voice Think Fast 2.0 High
81,3
97 %
95,1 %
56,5 %
1011
94,6 %
0,70
4,80
-
-
Logo von SpaceXAISpaceXAI
Grok Voice Think Fast 1.0
73,7
97 %
77,8 %
52,1 %
908
80,7 %
1,25
3,00
-
-
Logo von SpaceXAISpaceXAI
Grok Voice Fast 1.0
-
93 %
71,6 %
27,4 %
-
-
0,78
3,00
3,00
3,00
Logo von StepFunStepFun
StepAudio 3 Realtime
-
100 %
98,9 %
-
-
-
8,83
-
-
-
Logo von StepFunStepFun
Step-Audio R1.1 (Realtime)
-
98 %
-
-
-
-
1,53
0,00
0,06
1,69
Logo von VITAVITA
Freeze-Omni
-
33 %
58,7 %
-
-
-
-
-
-
-

Häufig gestellte Fragen