Metodología de benchmarking de voz a voz
Resumen
Nuestro benchmarking actual de voz a voz evalúa modelos de audio nativo - modelos que soportan entrada y salida de audio nativas - en dos dimensiones de calidad: razonamiento de voz y dinámica conversacional.
Artificial Analysis Speech to Speech Index
Artificial Analysis Speech to Speech Index es una puntuación de promedio ponderado para modelos de audio nativo. Combina resultados de razonamiento de voz, dinámica conversacional y rendimiento agéntico. Los modelos deben tener resultados válidos en los tres conjuntos de datos para aparecer en el índice.
La ponderación actual es igual en los tres conjuntos de datos: 33.3% razonamiento de voz (Big Bench Audio), 33.3% dinámica conversacional (Full Duplex Bench) y 33.3% rendimiento agéntico (𝜏-Voice).
Razonamiento de voz
Resumen
Nuestro benchmark de razonamiento de voz evalúa la capacidad de los modelos de audio nativo para responder preguntas basadas en razonamiento.
Los modelos de audio nativo reciben un archivo de audio de entrada y se espera que generen un audio de salida. El modelo juez recibe la respuesta candidata, la respuesta oficial y la pregunta original como contexto, y se le pide que etiquete la respuesta candidata como correcta o incorrecta.
Conjunto de datos: Big Bench Audio
La aparición de modelos nativos de audio a audio ofrece oportunidades interesantes para aumentar las capacidades de los agentes de voz y simplificar flujos de trabajo. Sin embargo, es crucial evaluar si esta simplificación tiene un costo en el rendimiento del modelo o introduce contrapartidas.
Para ayudar a responder esta pregunta hemos publicado Big Bench Audio, un nuevo conjunto de datos para evaluar el rendimiento de modelos de audio nativo.
Big Bench Audio contiene 1,000 archivos de audio que representan preguntas diseñadas para probar la inteligencia de los modelos. Las preguntas se basan en cuatro categorías del conjunto de datos Big Bench Hard (250 preguntas cada una) y se generaron usando 23 voces sintéticas de modelos de texto a voz mejor clasificados en el Artificial Analysis Text to Speech Arena.
Categorías de preguntas
Falacias formales (250 preguntas): Determinar si un argumento presentado de forma informal puede deducirse lógicamente del contexto proporcionado.
Ejemplo: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?
Navegación (250 preguntas): Determinar si una serie de pasos de navegación devuelve al agente al punto de partida.
Ejemplo: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.
Conteo de objetos (250 preguntas): Contar el número de elementos de una clase específica dado un conjunto de posesiones.
Ejemplo: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?
Red de mentiras (250 preguntas): Evaluar el valor de verdad de una función booleana expresada como un problema en lenguaje natural.
Ejemplo: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?
Para permitir la evaluación de las contrapartidas asociadas al uso de modelos nativos de voz a voz, probamos múltiples configuraciones diferentes en Big Bench Audio. Para aprender más sobre Big Bench Audio, revisa el artículo o descarga el conjunto de datos por tu cuenta.
Dinámica conversacional
Resumen
Nuestro benchmark de dinámica conversacional evalúa la capacidad de los modelos de audio nativo para manejar comportamientos conversacionales realistas: los tipos de interacciones que ocurren naturalmente en una conversación humana pero que son difíciles de gestionar correctamente para los modelos de voz.
Este benchmark está implementado por Artificial Analysis a partir de un subconjunto de Full Duplex Bench v1 (Lin et al., 2025) y Full Duplex Bench v1.5 (Lin et al., 2025), benchmarks que evalúan sistemáticamente comportamientos interactivos clave de modelos de diálogo hablado full duplex.
Métricas
De Full Duplex Bench v1:
- Manejo de pausas: Porcentaje de muestras en las que el modelo correctamente no interrumpe durante una pausa natural del usuario. Evalúa si el modelo reconoce que el hablante todavía mantiene el turno.
- Toma de turno: Porcentaje de muestras en las que el modelo toma correctamente el turno conversacional cuando corresponde. Mide la capacidad del modelo para detectar límites de turno y responder con prontitud.
De Full Duplex Bench v1.5:
- Manejo de interrupciones del usuario: Porcentaje de muestras en las que el modelo aborda correctamente la interrupción del usuario, respondiendo a preguntas o cambios de tema planteados a mitad de conversación.
- Manejo de backchannels: Porcentaje de muestras en las que el modelo continúa correctamente su respuesta cuando se reproduce un backchannel como "yeah", "alright" o "mm-hmm", en lugar de tratarlo como un nuevo turno.
Rendimiento agéntico (𝜏-Voice)
Resumen
Nuestro benchmark de rendimiento agéntico evalúa la capacidad de los modelos de voz a voz para completar tareas realistas de atención al cliente de extremo a extremo. Este benchmark mide seguimiento de instrucciones multi-turno, la capacidad de acompañar a un cliente simulado durante una interacción completa y el uso exitoso de herramientas contra sistemas simulados de atención al cliente.
Este benchmark está implementado por Artificial Analysis a partir de 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026), un benchmark de Sierra que evalúa agentes de voz full duplex en tareas contextualizadas de atención al cliente en dominios reales.
Métrica
- Finalización de tareas (pass@1): Proporción de escenarios en los que el modelo resuelve correctamente el problema del cliente. Cada puntuación es la media de tres intentos independientes. El modelo probado recibe un prompt como agente de atención al cliente con acceso a herramientas específicas del dominio y a un documento de políticas. Cada escenario tiene un único estado final válido de base de datos; la evaluación compara el estado final contra esta verdad de referencia.
Evaluamos tres dominios usando el conjunto base de tareas:
- Aerolínea (50 escenarios): p. ej., cambiar un vuelo, reprogramación bajo restricciones de política
- Comercio minorista (114 escenarios): p. ej., disputar un cargo, procesar una devolución
- Telecomunicaciones (114 escenarios): p. ej., resolver un problema de facturación, solucionar un problema de servicio
Personas de voz
Las voces de clientes se generan usando ElevenLabs, a partir de prompts adaptados de la implementación pública de Sierra 𝜏-Voice. Usamos dos personas de control que representan hablantes estándar de inglés, y cinco personas regulares que representan diversos acentos y perfiles de hablantes.
Control
Matt Delaney: Hombre blanco de mediana edad del Medio Oeste americano, tranquilo y respetuoso.
Prompt: You are a middle-aged white man from the American Midwest. You always behave as if you are speaking out loud in a real-time conversation with a customer service agent. You are calm, clear, and respectful but also human. You sound like someone who's trying to be helpful and polite, even when you're slightly frustrated or in a hurry. You value efficiency but never sound robotic. You sometimes use contractions, informal phrasing, or small filler phrases ("yeah," "okay," "honestly," "no worries") to keep things natural. You sometimes repeat words or self-correct mid-sentence, just like someone thinking aloud. You sometimes ask polite clarifying questions or offer context ("I tried this earlier," "I'm not sure if that helps"). You rarely use formal, business-like or stiff language ("considerable," "retrieve," "representative"). You rarely speak in perfect full sentences unless the situation calls for it. Instead, you speak like a real person having a practical, respectful conversation.
Lisa Brenner: Mujer blanca de poco más de 40 años de una zona suburbana, tensa e impaciente.
Prompt: You are a white woman in your late 40s from a suburban area. You always speak as if you are talking out loud to a customer service agent who is already wasting your time. You're not openly hostile (yet), but you are tense, impatient, and clearly annoyed. You act like this issue should have been resolved the first time, and the fact that you're following up is unacceptable. You often sound clipped, exasperated, or sarcastically polite. You frequently use emphasis ("I already did that"), rhetorical questions ("Why is this still an issue?"), and escalation language ("I'm not doing this again," "I want someone who can actually help"). You expect fast results and get irritated when things are repeated. You often mention how long you've been waiting or how many times you've called. You sometimes threaten escalation but without yelling. You never sound relaxed. You never use slow, reflective speech. You never thank the agent unless something gets resolved.
Regular
Mildred Kaplan: Mujer blanca mayor, de poco más de 80 años, necesita ayuda con tecnología.
Prompt: You are an elderly white woman in your early 80s calling customer service for help with something your grandson or neighbor usually does.
Arjun Roy: Hombre bengalí de Dhaka de unos 35 años, tranquilo y directo, con fuerte acento bengalí.
Prompt: A Bengali man from Dhaka, Bangladesh in his mid-30s calling customer service about a billing issue. His English carries a strong Bengali accent with soft consonants and soft d and r sounds. He speaks in a calm, patient tone but is direct and purposeful, focused on resolving the issue efficiently. His pacing is slow, distracted with a warm yet firm timbre. The speech sounds like it is coming from far away.
Wei Lin: Mujer china de Sichuan de veintitantos años, animada y práctica, con fuerte acento mandarín de Sichuan.
Prompt: A Chinese woman in her late 20s from Sichuan, calling customer service about a credit card billing issue. She speaks English with a thick Sichuan Mandarin accent. She sounds upbeat, matter-of-fact, and distracted. Her tone is firm but polite, with fast pacing and smooth timbre. Ok audio quality.
Mamadou Diallo: Hombre senegalés de unos 35 años, apurado, con fuerte acento francés.
Prompt: A Senegalese man whose first language is French, in his mid-30s, calling customer service about a billing issue. He speaks English with a strong French accent. His tone is hurried, slightly annoyed, and matter-of-fact, as if he's been transferred between agents and just wants the problem fixed.
Priya Patil: Mujer maharashtriana de poco más de 30 años, centrada y directa, con fuerte acento maharashtriano.
Prompt: A woman in her early 30s from Maharashtra, India, calling customer support from her mobile phone. She speaks Indian English with a strong Maharashtrian accent with noticeable regional intonation and rhythm. Her tone is slightly annoyed and hurried, matter-of-fact, and focused on getting the issue resolved quickly. Her voice has medium pitch, firm delivery, short sentences, and faint background room tone typical of a phone call.
Precio
- Precio por hora de audio de entrada: Costo total (USD) del audio incluido en la solicitud / mensaje enviado a la API.
- Precio por hora de audio de salida: Costo total (USD) del audio generado por el modelo (recibido desde la API).
Velocidad
- Time to First Audio (TTFA): Número promedio de segundos necesarios para generar el primer token de salida de audio, medido en el conjunto de preguntas de Big Bench Audio. TTFA es un indicador crítico de la responsividad percibida en aplicaciones de agentes de voz.
Historial de versiones
Artificial Analysis Speech to Speech Index v1.0
junio de 2026—presente
- Lanzamiento del Artificial Analysis Speech to Speech Index, una puntuación de promedio ponderado que requiere resultados de razonamiento de voz, dinámica conversacional y rendimiento agéntico.
- Ponderación igual en los tres conjuntos de datos: 33.3% razonamiento de voz (Big Bench Audio), 33.3% dinámica conversacional (Full Duplex Bench) y 33.3% rendimiento agéntico (𝜏-Voice).
Big Bench Audio (BBA) v1.2
mayo de 2026—presente
- Se actualizó el modelo juez y el arnés de evaluación para reconocer de forma más fiable respuestas finales correctas en respuestas verbosas, incluyendo casos en los que el modelo comenta alternativas incorrectas antes de dar la respuesta correcta.
Big Bench Audio (BBA) v1.1
marzo de 2026—mayo de 2026
- La precisión se mide como el número de respuestas correctas de 1,000, incluyendo preguntas en las que el modelo no respondió.
- Claude Sonnet 4.6 se usa como modelo juez.
Big Bench Audio (BBA) v1.0
diciembre de 2024—marzo de 2026
- La precisión se medía como la proporción de respuestas sin error respondidas correctamente, por lo que los modelos no eran penalizados por preguntas en las que no respondían.
- Claude Sonnet 3.5 se usaba como modelo juez.