Tabla de clasificación de modelos y proveedores de IA de voz a voz

Análisis y comparación de modelos de voz a voz y proveedores de API. Artificial Analysis ha analizado modelos de voz a voz y proveedores de hosting según distintas características, como su calidad de razonamiento, dinámica conversacional, tiempo de generación y precio.

Para más detalles, consulta la página de metodología.

Weighted average of Speech Reasoning, Agentic Performance, Arena Preference, and Task Success Rate results · Higher is better
Time to first audio (seconds) on Big Bench Audio · Lower is better
Cost to complete fixed 40-question Big Bench Audio subset based on length of input audio, normalized to hourly basis · Lower is better

Artificial Analysis Speech to Speech Index

Artificial Analysis Speech to Speech Index

Weighted average of Speech Reasoning, Agentic Performance, Arena Preference, and Task Success Rate results · Only models with all data available shown · Higher is better

Razonamiento de voz

Razonamiento de voz (Big Bench Audio)

Speech reasoning: based on the Artificial Analysis Big Bench Audio dataset · Higher is better

Rendimiento agéntico

Rendimiento agéntico (𝜏-Voice)

Proportion of replica customer service scenarios resolved while acting as a customer support agent, based on the 𝜏-Voice benchmark · Higher is better · Only full duplex models

Nota: Modelos basados en 1 ejecución: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Modelos basados en 2 ejecuciones: GPT-Realtime-2.1 High, OpenAI

Rendimiento agéntico (𝜏-Voice) por dominio

Proportion of replica customer service scenarios resolved by domain, based on the 𝜏-Voice benchmark · Higher is better · Only full duplex models

Nota: Modelos basados en 1 ejecución: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Modelos basados en 2 ejecuciones: GPT-Realtime-2.1 High, OpenAI

Speech Agent Arena

Elo de preferencia de Arena

Preference Elo measures human participants' overall preference after they complete the same scenario with two unidentified Speech to Speech models, such as booking a dental appointment · Only includes models with tool calling · Higher is better

Tasa de éxito de tareas

Proportion of eligible conversations with the correct final task-completing tool call or calls · Higher is better

Dinámica conversacional

Dinámica conversacional (subconjunto de Full Duplex Bench)

Weighted average of pause handling, turn-taking, interruption handling, and backchannel handling from Full Duplex Bench v1 and v1.5 · Higher is better

Dinámica conversacional (subconjunto de Full Duplex Bench): desglose por categoría

Puntuaciones individuales por categoría, ordenadas por puntuación de dinámica conversacional · Basado en un subconjunto de Full Duplex Bench v1 y v1.5

Benchmarks de API

Costo por hora de audio de entrada (subconjunto de Big Bench Audio)

Cost to complete fixed 40-question Big Bench Audio subset based on length of input audio, normalized to hourly basis · Lower is better

Razonamiento de voz (Big Bench Audio) vs. costo por hora de audio de entrada

Puntuación de Big Bench Audio vs. costo por hora de audio de entrada, medido en un subconjunto fijo de 40 preguntas · Mayor razonamiento de voz y menor costo es mejor
Most attractive quadrant

Time to First Audio

Average time to first audio (seconds) on Big Bench Audio dataset · Lower is better

Razonamiento de voz (Big Bench Audio) vs. velocidad

Puntuación de Big Bench Audio vs. tiempo hasta el primer audio · Mayor razonamiento de voz y menor latencia es mejor
Most attractive quadrant

Resumen de métricas clave e información adicional

Logo de Alibaba CloudAlibaba Cloud
Qwen Audio 3.0 Realtime Plus
69,5
99 %
98,4 %
54,6 %
775
77,8 %
1,54
4,42
0,03
0,18
Logo de Alibaba CloudAlibaba Cloud
Qwen3.5 Omni Plus Realtime
-
99 %
-
-
859
62,0 %
2,64
0,00
0,16
0,82
Logo de Alibaba CloudAlibaba Cloud
Qwen Audio 3.0 Realtime Flash
67,7
96 %
96,9 %
35,9 %
850
81,7 %
1,55
4,77
-
-
Logo de Alibaba CloudAlibaba Cloud
Qwen3.5 Omni Flash Realtime
-
59 %
-
-
841
29,1 %
0,79
0,00
0,16
0,82
Logo de Alibaba CloudAlibaba Cloud
Qwen3 Omni Flash
-
59 %
72,7 %
-
-
-
4,82
1,77
0,61
1,36
Logo de Alibaba CloudAlibaba Cloud
Qwen3 Omni Realtime
-
57 %
-
-
-
-
0,88
2,26
0,65
0,99
Logo de Amazon BedrockAmazon Bedrock
Nova 2.0 Sonic (Mar 2026)
-
88 %
-
-
974
57,1 %
1,14
4,89
0,27
1,08
Logo de Boson AIBoson AI
Higgs Realtime
-
69 %
92,8 %
18,6 %
-
-
1,47
-
-
-
Logo de Cofe AICofe AI
FLM-Audio
-
16 %
62,0 %
-
-
-
-
-
-
-
Logo de DeepslateDeepslate
Deepslate Opal
-
85 %
85,7 %
17,5 %
-
-
0,44
6,48
-
-
Logo de GoogleGoogle
Gemini 3.8 Live Extended Thinking (High)
82,6
98 %
91,9 %
68,6 %
990
89,1 %
1,35
3,50
-
-
Logo de GoogleGoogle
Gemini 3.1 Flash Live High
72,0
97 %
74,3 %
37,7 %
1063
71,8 %
2,99
1,75
0,35
1,38
Logo de GoogleGoogle
Gemini 3.8 Live
76,0
92 %
96,1 %
30,1 %
1083
93,2 %
1,18
0,84
-
-
Logo de GoogleGoogle
Gemini 2.5 Flash Native Audio Dialog Thinking
-
91 %
-
-
-
-
3,87
-
0,35
1,38
Logo de GoogleGoogle
Gemini 3.1 Flash Live Minimal
64,2
71 %
72,3 %
26,2 %
1096
74,6 %
0,96
1,50
0,35
1,38
Logo de GoogleGoogle
Gemini 2.5 Flash Native Audio Dialog
-
69 %
-
-
-
-
0,63
1,42
0,35
1,38
Logo de GoogleGoogle
Gemini 2.5 Flash Native Audio Preview (Dec 2025)
-
-
44,0 %
22,8 %
-
-
-
-
-
-
Logo de GoogleGoogle
Gemini 2.5 Flash Native Audio Preview (Sep 2025)
-
-
30,3 %
-
-
-
-
-
-
-
Logo de KraftonKrafton
Raon SpeechChat
-
58 %
86,2 %
-
-
-
0,04
-
-
-
Logo de KyutaiKyutai
Moshi
-
4 %
61,0 %
-
-
-
-
-
-
-
Logo de NVIDIANVIDIA
Nemotron Voicechat
-
27 %
52,9 %
-
-
-
-
-
-
-
Logo de NVIDIANVIDIA
PersonaPlex
-
19 %
91,0 %
-
-
-
-
-
-
-
Logo de OpenAIOpenAI
GPT-Realtime-2 (High)
73,6
97 %
95,3 %
39,8 %
932
89,8 %
1,14
4,14
1,15
4,61
Logo de OpenAIOpenAI
GPT-Realtime-2.1 High
75,2
96 %
95,7 %
45,7 %
928
91,5 %
1,21
10,75
-
-
Logo de OpenAIOpenAI
GPT-Realtime-2 (Medium)
-
93 %
95,2 %
37,4 %
-
-
1,22
3,97
1,15
4,61
Logo de OpenAIOpenAI
GPT-Live-1 (Astra, medium)
83,2
90 %
94,9 %
74,5 %
1048
87,4 %
1,34
5,83
-
-
Logo de OpenAIOpenAI
GPT-Live-1 (Sol, low)
80,1
89 %
97,3 %
59,3 %
1053
90,9 %
1,24
4,47
-
-
Logo de OpenAIOpenAI
GPT-Realtime-2.1 Minimal
70,7
87 %
92,7 %
38,0 %
937
89,4 %
0,97
11,31
-
-
Logo de OpenAIOpenAI
GPT Realtime (Aug '25)
69,1
83 %
93,9 %
30,4 %
974
89,4 %
0,98
11,08
1,15
4,61
Logo de OpenAIOpenAI
GPT-Realtime-1.5
70,3
81 %
95,7 %
38,8 %
1000
85,1 %
0,81
11,44
1,15
4,61
Logo de OpenAIOpenAI
GPT-Realtime-2.1 Mini High
-
75 %
91,7 %
29,4 %
-
-
4,28
3,45
-
-
Logo de OpenAIOpenAI
GPT-Realtime-2 (Minimal)
63,3
72 %
96,1 %
30,8 %
916
84,7 %
1,12
3,07
1,15
4,61
Logo de OpenAIOpenAI
GPT-4o mini Realtime (Dec 2024)
-
69 %
-
-
-
-
1,27
5,75
0,36
1,44
Logo de OpenAIOpenAI
GPT Realtime Mini (Oct '25)
56,1
64 %
95,7 %
15,1 %
917
79,6 %
0,81
3,04
0,36
1,44
Logo de OpenAIOpenAI
GPT-Realtime-2.1 Mini Minimal
54,4
63 %
91,8 %
22,5 %
840
76,7 %
0,85
4,60
-
-
Logo de OpenAIOpenAI
GPT-4o audio chatcompletions
-
54 %
-
-
-
-
3,38
0,00
3,60
14,40
Logo de OpenAIOpenAI
GPT-4o Realtime (Dec 2024)
-
-
89,8 %
27,9 %
-
-
1,49
2,04
1,44
5,76
Logo de SpaceXAISpaceXAI
Grok Voice Think Fast 2.0 High
81,3
97 %
95,1 %
56,5 %
1011
94,6 %
0,70
4,80
-
-
Logo de SpaceXAISpaceXAI
Grok Voice Think Fast 1.0
73,7
97 %
77,8 %
52,1 %
908
80,7 %
1,25
3,00
-
-
Logo de SpaceXAISpaceXAI
Grok Voice Fast 1.0
-
93 %
71,6 %
27,4 %
-
-
0,78
3,00
3,00
3,00
Logo de StepFunStepFun
StepAudio 3 Realtime
-
100 %
98,9 %
-
-
-
8,83
-
-
-
Logo de StepFunStepFun
Step-Audio R1.1 (Realtime)
-
98 %
-
-
-
-
1,53
0,00
0,06
1,69
Logo de VITAVITA
Freeze-Omni
-
33 %
58,7 %
-
-
-
-
-
-
-

Preguntas frecuentes