Tabla de clasificación de modelos y proveedores de IA de voz a voz
Análisis y comparación de modelos de voz a voz y proveedores de API. Artificial Analysis ha analizado modelos de voz a voz y proveedores de hosting según distintas características, como su calidad de razonamiento, dinámica conversacional, tiempo de generación y precio.
Para más detalles, consulta la página de metodología.
Artificial Analysis Speech to Speech Index
Artificial Analysis Speech to Speech Index
Razonamiento de voz
Razonamiento de voz (Big Bench Audio)
Rendimiento agéntico
Rendimiento agéntico (𝜏-Voice)
Nota: Modelos basados en 1 ejecución: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Modelos basados en 2 ejecuciones: GPT-Realtime-2.1 High, OpenAI
Rendimiento agéntico (𝜏-Voice) por dominio
Nota: Modelos basados en 1 ejecución: GPT-Live-1 (Astra, medium), OpenAI, GPT-Live-1 (Sol, low), OpenAI, GPT-Realtime-2 (Minimal), OpenAI; Modelos basados en 2 ejecuciones: GPT-Realtime-2.1 High, OpenAI
Speech Agent Arena
Elo de preferencia de Arena
Tasa de éxito de tareas
Dinámica conversacional
Dinámica conversacional (subconjunto de Full Duplex Bench)
Dinámica conversacional (subconjunto de Full Duplex Bench): desglose por categoría
Benchmarks de API
Costo por hora de audio de entrada (subconjunto de Big Bench Audio)
Razonamiento de voz (Big Bench Audio) vs. costo por hora de audio de entrada
Time to First Audio
Razonamiento de voz (Big Bench Audio) vs. velocidad
Resumen de métricas clave e información adicional
Qwen Audio 3.0 Realtime Plus | 69,5 | 99 % | 98,4 % | 54,6 % | 775 | 77,8 % | 1,54 | 4,42 | 0,03 | 0,18 | |
Qwen3.5 Omni Plus Realtime | - | 99 % | - | - | 859 | 62,0 % | 2,64 | 0,00 | 0,16 | 0,82 | |
Qwen Audio 3.0 Realtime Flash | 67,7 | 96 % | 96,9 % | 35,9 % | 850 | 81,7 % | 1,55 | 4,77 | - | - | |
Qwen3.5 Omni Flash Realtime | - | 59 % | - | - | 841 | 29,1 % | 0,79 | 0,00 | 0,16 | 0,82 | |
Qwen3 Omni Flash | - | 59 % | 72,7 % | - | - | - | 4,82 | 1,77 | 0,61 | 1,36 | |
Qwen3 Omni Realtime | - | 57 % | - | - | - | - | 0,88 | 2,26 | 0,65 | 0,99 | |
Nova 2.0 Sonic (Mar 2026) | - | 88 % | - | - | 974 | 57,1 % | 1,14 | 4,89 | 0,27 | 1,08 | |
Higgs Realtime | - | 69 % | 92,8 % | 18,6 % | - | - | 1,47 | - | - | - | |
FLM-Audio | - | 16 % | 62,0 % | - | - | - | - | - | - | - | |
Deepslate Opal | - | 85 % | 85,7 % | 17,5 % | - | - | 0,44 | 6,48 | - | - | |
Gemini 3.8 Live Extended Thinking (High) | 82,6 | 98 % | 91,9 % | 68,6 % | 990 | 89,1 % | 1,35 | 3,50 | - | - | |
Gemini 3.1 Flash Live High | 72,0 | 97 % | 74,3 % | 37,7 % | 1063 | 71,8 % | 2,99 | 1,75 | 0,35 | 1,38 | |
Gemini 3.8 Live | 76,0 | 92 % | 96,1 % | 30,1 % | 1083 | 93,2 % | 1,18 | 0,84 | - | - | |
Gemini 2.5 Flash Native Audio Dialog Thinking | - | 91 % | - | - | - | - | 3,87 | - | 0,35 | 1,38 | |
Gemini 3.1 Flash Live Minimal | 64,2 | 71 % | 72,3 % | 26,2 % | 1096 | 74,6 % | 0,96 | 1,50 | 0,35 | 1,38 | |
Gemini 2.5 Flash Native Audio Dialog | - | 69 % | - | - | - | - | 0,63 | 1,42 | 0,35 | 1,38 | |
Gemini 2.5 Flash Native Audio Preview (Dec 2025) | - | - | 44,0 % | 22,8 % | - | - | - | - | - | - | |
Gemini 2.5 Flash Native Audio Preview (Sep 2025) | - | - | 30,3 % | - | - | - | - | - | - | - | |
Raon SpeechChat | - | 58 % | 86,2 % | - | - | - | 0,04 | - | - | - | |
Moshi | - | 4 % | 61,0 % | - | - | - | - | - | - | - | |
Nemotron Voicechat | - | 27 % | 52,9 % | - | - | - | - | - | - | - | |
PersonaPlex | - | 19 % | 91,0 % | - | - | - | - | - | - | - | |
GPT-Realtime-2 (High) | 73,6 | 97 % | 95,3 % | 39,8 % | 932 | 89,8 % | 1,14 | 4,14 | 1,15 | 4,61 | |
GPT-Realtime-2.1 High | 75,2 | 96 % | 95,7 % | 45,7 % | 928 | 91,5 % | 1,21 | 10,75 | - | - | |
GPT-Realtime-2 (Medium) | - | 93 % | 95,2 % | 37,4 % | - | - | 1,22 | 3,97 | 1,15 | 4,61 | |
GPT-Live-1 (Astra, medium) | 83,2 | 90 % | 94,9 % | 74,5 % | 1048 | 87,4 % | 1,34 | 5,83 | - | - | |
GPT-Live-1 (Sol, low) | 80,1 | 89 % | 97,3 % | 59,3 % | 1053 | 90,9 % | 1,24 | 4,47 | - | - | |
GPT-Realtime-2.1 Minimal | 70,7 | 87 % | 92,7 % | 38,0 % | 937 | 89,4 % | 0,97 | 11,31 | - | - | |
GPT Realtime (Aug '25) | 69,1 | 83 % | 93,9 % | 30,4 % | 974 | 89,4 % | 0,98 | 11,08 | 1,15 | 4,61 | |
GPT-Realtime-1.5 | 70,3 | 81 % | 95,7 % | 38,8 % | 1000 | 85,1 % | 0,81 | 11,44 | 1,15 | 4,61 | |
GPT-Realtime-2.1 Mini High | - | 75 % | 91,7 % | 29,4 % | - | - | 4,28 | 3,45 | - | - | |
GPT-Realtime-2 (Minimal) | 63,3 | 72 % | 96,1 % | 30,8 % | 916 | 84,7 % | 1,12 | 3,07 | 1,15 | 4,61 | |
GPT-4o mini Realtime (Dec 2024) | - | 69 % | - | - | - | - | 1,27 | 5,75 | 0,36 | 1,44 | |
GPT Realtime Mini (Oct '25) | 56,1 | 64 % | 95,7 % | 15,1 % | 917 | 79,6 % | 0,81 | 3,04 | 0,36 | 1,44 | |
GPT-Realtime-2.1 Mini Minimal | 54,4 | 63 % | 91,8 % | 22,5 % | 840 | 76,7 % | 0,85 | 4,60 | - | - | |
GPT-4o audio chatcompletions | - | 54 % | - | - | - | - | 3,38 | 0,00 | 3,60 | 14,40 | |
GPT-4o Realtime (Dec 2024) | - | - | 89,8 % | 27,9 % | - | - | 1,49 | 2,04 | 1,44 | 5,76 | |
Grok Voice Think Fast 2.0 High | 81,3 | 97 % | 95,1 % | 56,5 % | 1011 | 94,6 % | 0,70 | 4,80 | - | - | |
Grok Voice Think Fast 1.0 | 73,7 | 97 % | 77,8 % | 52,1 % | 908 | 80,7 % | 1,25 | 3,00 | - | - | |
Grok Voice Fast 1.0 | - | 93 % | 71,6 % | 27,4 % | - | - | 0,78 | 3,00 | 3,00 | 3,00 | |
StepAudio 3 Realtime | - | 100 % | 98,9 % | - | - | - | 8,83 | - | - | - | |
Step-Audio R1.1 (Realtime) | - | 98 % | - | - | - | - | 1,53 | 0,00 | 0,06 | 1,69 | |
Freeze-Omni | - | 33 % | 58,7 % | - | - | - | - | - | - | - |
Preguntas frecuentes
StepAudio 3 Realtime lidera con una puntuación de razonamiento de voz de 99,7 % en el conjunto de datos Big Bench Audio, entre 40 modelos evaluados. Le siguen Qwen Audio 3.0 Realtime Plus con 99,2 % y Qwen3.5 Omni Plus Realtime con 98,7 %.
StepAudio 3 Realtime lidera con una puntuación de dinámica conversacional de 98,9 % en el conjunto de datos Full Duplex Bench, entre 34 modelos evaluados. Le siguen Qwen Audio 3.0 Realtime Plus con 98,4 % y GPT-Live-1 (Sol, low) con 97,3 %.
Los mejores modelos de voz a voz por calidad de razonamiento son: 1. StepAudio 3 Realtime (99,7 %), 2. Qwen Audio 3.0 Realtime Plus (99,2 %), 3. Qwen3.5 Omni Plus Realtime (98,7 %), 4. Gemini 3.8 Live Extended Thinking (High) (97,7 %) y 5. Step-Audio R1.1 (Realtime) (97,6 %). Las puntuaciones se basan en el benchmark Big Bench Audio.
Los mejores modelos de voz a voz por dinámica conversacional son: 1. StepAudio 3 Realtime (98,9 %), 2. Qwen Audio 3.0 Realtime Plus (98,4 %), 3. GPT-Live-1 (Sol, low) (97,3 %), 4. Qwen Audio 3.0 Realtime Flash (96,9 %) y 5. Gemini 3.8 Live (96,1 %). Las puntuaciones se basan en el benchmark Full Duplex Bench.
Raon SpeechChat tiene el menor Time to First Audio, con 0,04s, seguido de Deepslate Opal (0,44s) y Gemini 2.5 Flash Native Audio Dialog (0,63s). Los valores más bajos indican una respuesta inicial más rápida.
Qwen Audio 3.0 Realtime Plus es el más económico, con 0,0331 US$/hora de audio de entrada, seguido de Step-Audio R1.1 (Realtime) (0,064 US$/hora) y Qwen3.5 Omni Plus Realtime (0,162 US$/hora).
Full Duplex Bench evalúa qué tan bien manejan los modelos de voz a voz los comportamientos conversacionales reales: saber cuándo hablar, cuándo guardar silencio durante las pausas, cómo responder a las interrupciones y cómo reconocer backchannels como "sí" o "ajá". Artificial Analysis implementa un subconjunto de Full Duplex Bench v1 y v1.5.
El razonamiento de voz (Big Bench Audio) mide si un modelo puede entender y responder correctamente preguntas de razonamiento planteadas en audio. La dinámica conversacional (Full Duplex Bench) mide si un modelo puede manejar el flujo natural de una conversación: toma de turno, pausas e interrupciones. Un modelo puede destacar en una y no en la otra.
Las conversaciones en tiempo real requieren tanto una buena dinámica conversacional como baja latencia. Por puntuación de dinámica conversacional, StepAudio 3 Realtime (98,9 %), Qwen Audio 3.0 Realtime Plus (98,4 %) y GPT-Live-1 (Sol, low) (97,3 %) lideran. Por Time to First Audio, Raon SpeechChat (0,04s), Deepslate Opal (0,44s) y Gemini 2.5 Flash Native Audio Dialog (0,63s) son los más rápidos. La mejor opción depende de si el flujo natural de la conversación o la velocidad de respuesta es más importante para tu caso de uso.
Los benchmarks se actualizan regularmente a medida que se agregan nuevos modelos y proveedores. Las métricas de rendimiento se monitorean de forma continua para reflejar las capacidades y los cambios de precios actuales de los proveedores.