Metodología de benchmarking de voz a voz

Resumen

Nuestro benchmarking actual de voz a voz evalúa modelos de audio nativo - modelos que soportan entrada y salida de audio nativas - en dos dimensiones de calidad: razonamiento de voz y dinámica conversacional.

Artificial Analysis Speech to Speech Index

Artificial Analysis Speech to Speech Index es una puntuación con ponderación igualitaria para modelos de audio nativo. Combina resultados de razonamiento de voz, rendimiento agéntico, preferencia de Arena y tasa de éxito de tareas. Los modelos deben tener resultados válidos en los cuatro componentes para aparecer en el índice.

La ponderación actual es igual en los cuatro componentes: 25% razonamiento de voz (Big Bench Audio), 25% rendimiento agéntico (𝜏-Voice), 25% preferencia de Arena (Arena Score) y 25% tasa de éxito de tareas.

Razonamiento de voz

Resumen

Nuestro benchmark de razonamiento de voz evalúa la capacidad de los modelos de audio nativo para responder preguntas basadas en razonamiento.

Los modelos de audio nativo reciben un archivo de audio de entrada y se espera que generen un audio de salida. El modelo juez recibe la respuesta candidata, la respuesta oficial y la pregunta original como contexto, y se le pide que etiquete la respuesta candidata como correcta o incorrecta.

Conjunto de datos: Big Bench Audio

La aparición de modelos nativos de audio a audio ofrece oportunidades interesantes para aumentar las capacidades de los agentes de voz y simplificar flujos de trabajo. Sin embargo, es crucial evaluar si esta simplificación tiene un costo en el rendimiento del modelo o introduce contrapartidas.

Para ayudar a responder esta pregunta hemos publicado Big Bench Audio, un nuevo conjunto de datos para evaluar el rendimiento de modelos de audio nativo.

Big Bench Audio contiene 1,000 archivos de audio que representan preguntas diseñadas para probar la inteligencia de los modelos. Las preguntas se basan en cuatro categorías del conjunto de datos Big Bench Hard (250 preguntas cada una) y se generaron usando 23 voces sintéticas de modelos de texto a voz mejor clasificados en el Artificial Analysis Text to Speech Arena.

Categorías de preguntas

Falacias formales (250 preguntas): Determinar si un argumento presentado de forma informal puede deducirse lógicamente del contexto proporcionado.

Ejemplo: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?

Navegación (250 preguntas): Determinar si una serie de pasos de navegación devuelve al agente al punto de partida.

Ejemplo: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.

Conteo de objetos (250 preguntas): Contar el número de elementos de una clase específica dado un conjunto de posesiones.

Ejemplo: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?

Red de mentiras (250 preguntas): Evaluar el valor de verdad de una función booleana expresada como un problema en lenguaje natural.

Ejemplo: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?

Para permitir la evaluación de las contrapartidas asociadas al uso de modelos nativos de voz a voz, probamos múltiples configuraciones diferentes en Big Bench Audio. Para aprender más sobre Big Bench Audio, revisa el artículo o descarga el conjunto de datos por tu cuenta.

Dinámica conversacional

Resumen

Nuestro benchmark de dinámica conversacional evalúa la capacidad de los modelos de audio nativo para manejar comportamientos conversacionales realistas: los tipos de interacciones que ocurren naturalmente en una conversación humana pero que son difíciles de gestionar correctamente para los modelos de voz.

Este benchmark está implementado por Artificial Analysis a partir de un subconjunto de Full Duplex Bench v1 (Lin et al., 2025) y Full Duplex Bench v1.5 (Lin et al., 2025), benchmarks que evalúan sistemáticamente comportamientos interactivos clave de modelos de diálogo hablado full duplex.

Métricas

De Full Duplex Bench v1:

  • Manejo de pausas: Porcentaje de muestras en las que el modelo correctamente no interrumpe durante una pausa natural del usuario. Evalúa si el modelo reconoce que el hablante todavía mantiene el turno.
  • Toma de turno: Porcentaje de muestras en las que el modelo toma correctamente el turno conversacional cuando corresponde. Mide la capacidad del modelo para detectar límites de turno y responder con prontitud.

De Full Duplex Bench v1.5:

  • Manejo de interrupciones del usuario: Porcentaje de muestras en las que el modelo aborda correctamente la interrupción del usuario, respondiendo a preguntas o cambios de tema planteados a mitad de conversación.
  • Manejo de backchannels: Porcentaje de muestras en las que el modelo continúa correctamente su respuesta cuando se reproduce un backchannel como "yeah", "alright" o "mm-hmm", en lugar de tratarlo como un nuevo turno.

Rendimiento agéntico (𝜏-Voice)

Resumen

Nuestro benchmark de rendimiento agéntico evalúa la capacidad de los modelos de voz a voz para completar tareas realistas de atención al cliente de extremo a extremo. Este benchmark mide seguimiento de instrucciones multi-turno, la capacidad de acompañar a un cliente simulado durante una interacción completa y el uso exitoso de herramientas contra sistemas simulados de atención al cliente.

Este benchmark está implementado por Artificial Analysis a partir de 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026), un benchmark de Sierra que evalúa agentes de voz full duplex en tareas contextualizadas de atención al cliente en dominios reales.

Métrica

  • Finalización de tareas (pass@1): Proporción de escenarios en los que el modelo resuelve correctamente el problema del cliente. Cada puntuación es la media de tres intentos independientes. El modelo probado recibe un prompt como agente de atención al cliente con acceso a herramientas específicas del dominio y a un documento de políticas. Cada escenario tiene un único estado final válido de base de datos; la evaluación compara el estado final contra esta verdad de referencia.

Evaluamos tres dominios usando el conjunto base de tareas:

  • Aerolínea (50 escenarios): p. ej., cambiar un vuelo, reprogramación bajo restricciones de política
  • Comercio minorista (114 escenarios): p. ej., disputar un cargo, procesar una devolución
  • Telecomunicaciones (114 escenarios): p. ej., resolver un problema de facturación, solucionar un problema de servicio

Personas de voz

Las voces de clientes se generan usando ElevenLabs, a partir de prompts adaptados de la implementación pública de Sierra 𝜏-Voice. Usamos dos personas de control que representan hablantes estándar de inglés, y cinco personas regulares que representan diversos acentos y perfiles de hablantes.

Speech Agent Arena

Resumen

Speech Agent Arena es un benchmark de preferencias con identidades ocultas que evalúa qué modelo de audio nativo prefieren los participantes en conversaciones de voz en vivo. Complementa nuestros benchmarks automatizados al medir la experiencia de conversación de principio a fin en tareas realistas con participantes humanos.

En cada ronda, un participante recibe un escenario, lo completa por separado con dos modelos de identidad oculta y, después de ambas llamadas, debe elegir cuál prefiere en general. Los participantes también responden preguntas de diagnóstico, que registramos por separado del voto de preferencia general.

Métricas

  • Elo de preferencia: El Elo de preferencia se calcula por separado para todos los escenarios, los escenarios agénticos y los no agénticos mediante máxima verosimilitud de Bradley–Terry. Los intervalos de confianza aproximados del 95% usan el mismo método basado en la matriz hessiana que TTS Arena, con GPT Realtime 1.5 como ancla de la escala en 1000 Elo.
  • Tasa de éxito de tareas: La tasa de éxito de tareas es el porcentaje de conversaciones elegibles en las que el modelo realizó correctamente la llamada o las llamadas finales a herramientas necesarias para completar la tarea. Las conversaciones elegibles son la suma de los éxitos y los fallos del modelo; las desviaciones de los participantes y los casos no verificables se excluyen antes del cálculo.

Conjunto de datos / Configuración de la evaluación

Arena incluye 35 escenarios: 15 agénticos con llamadas a herramientas y 20 no agénticos sin herramientas.

  • Agénticos (15 escenarios): Los modelos reciben herramientas pertinentes para completar la tarea asignada.

    Ejemplos:

    • Reserva una revisión dental para un paciente nuevo el martes a las 9:30 a. m. o, si ese horario está ocupado, en el primer horario disponible por la mañana.
    • Pide a domicilio dos pizzas diferentes y un acompañamiento, manteniendo el total, incluido el envío, por debajo de 45 dólares.
  • No agénticos (20 escenarios): Los modelos completan la conversación sin herramientas, utilizando la información del prompt del sistema.

    Ejemplos:

    • Pregunta por el horario de la piscina los domingos, los precios de las entradas familiares y la disponibilidad de toallas.
    • Pregunta por las clases de yoga para principiantes, los precios de las clases y las membresías, y qué debes llevar.

Consulta la descripción general de Speech Agent Arena para ver una ronda de ejemplo de Arena, las entradas de los modelos, los esquemas de herramientas y ejemplos de conversaciones.

Tasa de éxito de tareas

Paso 1: Elegibilidad del participante. El juez 1 recibe el escenario asignado, la transcripción y las definiciones de las llamadas finales requeridas. Comprueba que el participante intentó realizar la tarea asignada, se mantuvo sustancialmente dentro de su alcance, comunicó una solicitud final o aceptó un resultado que se puede evaluar y dio al modelo una oportunidad razonable de actuar. Solo las conversaciones elegibles continúan al paso 2.

Paso 2a: Llamadas finales requeridas. Para las conversaciones elegibles, el juez 2 recibe las llamadas finales requeridas y el registro cronológico completo de las llamadas a herramientas. Comprueba que se realizaron todas las llamadas finales requeridas con la herramienta y el número de llamadas correctos, sin acciones finales no solicitadas. Las llamadas de apoyo y end_call no se puntúan como finalización de la tarea.

Paso 2b: Argumentos de las llamadas finales. La misma evaluación del juez 2 comprueba que se proporcionaron todos los argumentos exigidos por el esquema y que coincidieron con la solicitud final expresada verbalmente por el participante y con el contexto de la conversación. Se permiten formulaciones operativamente equivalentes y variaciones de transcripción que no alteren el resultado. Un intento fallido que luego se corrige puede aprobarse; la ausencia de llamadas, los argumentos incorrectos o las acciones finales adicionales hacen que la evaluación falle.

Reglas de publicación

  • Los resultados generales se publican para los modelos con al menos 100 apariciones y una semiamplitud del intervalo de confianza del 95% no mayor que 75.
  • No se publican las grabaciones ni las transcripciones de los participantes. Solo se mostrarán ejemplos una vez confirmado el consentimiento para la grabación y tras revisar y ocultar cualquier dato personal.

Reportamos un intervalo de confianza del 95% para la tasa de éxito de tareas de cada modelo mediante el intervalo de puntuación de Wilson. Las desviaciones de los participantes y las conversaciones no verificables se excluyen antes del cálculo.

Integración en el índice de voz a voz

Para uso exclusivo en el Artificial Analysis Speech to Speech Index:

Arena Score: Arena Score convierte el Elo de un modelo en preferencia esperada frente a una línea base de 800 Elo, usando un Elo congelado en el momento en que el modelo pasó a ser apto para publicación.

Arena Score = 100 / (1 + 10^((800 − frozen Elo) / 400))

Precio

  • Precio por hora de audio de entrada: Costo total (USD) del audio incluido en la solicitud / mensaje enviado a la API.
  • Precio por hora de audio de salida: Costo total (USD) del audio generado por el modelo (recibido desde la API).

Velocidad

  • Time to First Audio (TTFA): Número promedio de segundos necesarios para generar el primer token de salida de audio, medido en el conjunto de preguntas de Big Bench Audio. TTFA es un indicador crítico de la responsividad percibida en aplicaciones de agentes de voz.

Historial de versiones

Artificial Analysis Speech to Speech Index v2.0

agosto de 2026—presente

  • Se reemplazó dinámica conversacional (Full Duplex Bench) por tasa de éxito de tareas en el índice.
  • Ponderación igual en los cuatro componentes: 25% razonamiento de voz (Big Bench Audio), 25% rendimiento agéntico (𝜏-Voice), 25% preferencia de Arena (Arena Score) y 25% tasa de éxito de tareas.

Artificial Analysis Speech to Speech Index v1.1

agosto de 2026

  • Se añadió Speech Agent Arena al Artificial Analysis Speech to Speech Index.
  • Ponderación igual en los cuatro conjuntos de datos: 25% razonamiento de voz (Big Bench Audio), 25% dinámica conversacional (Full Duplex Bench), 25% rendimiento agéntico (𝜏-Voice) y 25% Speech Agent Arena.

Artificial Analysis Speech to Speech Index v1.0

junio de 2026—presente

  • Lanzamiento del Artificial Analysis Speech to Speech Index, una puntuación de promedio ponderado que requiere resultados de razonamiento de voz, dinámica conversacional y rendimiento agéntico.
  • Ponderación igual en los tres conjuntos de datos: 33.3% razonamiento de voz (Big Bench Audio), 33.3% dinámica conversacional (Full Duplex Bench) y 33.3% rendimiento agéntico (𝜏-Voice).

Big Bench Audio (BBA) v1.2

mayo de 2026—presente

  • Se actualizó el modelo juez y el arnés de evaluación para reconocer de forma más fiable respuestas finales correctas en respuestas verbosas, incluyendo casos en los que el modelo comenta alternativas incorrectas antes de dar la respuesta correcta.

Big Bench Audio (BBA) v1.1

marzo de 2026—mayo de 2026

  • La precisión se mide como el número de respuestas correctas de 1,000, incluyendo preguntas en las que el modelo no respondió.
  • Claude Sonnet 4.6 se usa como modelo juez.

Big Bench Audio (BBA) v1.0

diciembre de 2024—marzo de 2026

  • La precisión se medía como la proporción de respuestas sin error respondidas correctamente, por lo que los modelos no eran penalizados por preguntas en las que no respondían.
  • Claude Sonnet 3.5 se usaba como modelo juez.