Metodología de benchmarking de voz a voz
Resumen
Nuestro benchmarking actual de voz a voz evalúa modelos de audio nativo - modelos que soportan entrada y salida de audio nativas - en dos dimensiones de calidad: razonamiento de voz y dinámica conversacional.
Artificial Analysis Speech to Speech Index
Artificial Analysis Speech to Speech Index es una puntuación con ponderación igualitaria para modelos de audio nativo. Combina resultados de razonamiento de voz, rendimiento agéntico, preferencia de Arena y tasa de éxito de tareas. Los modelos deben tener resultados válidos en los cuatro componentes para aparecer en el índice.
La ponderación actual es igual en los cuatro componentes: 25% razonamiento de voz (Big Bench Audio), 25% rendimiento agéntico (𝜏-Voice), 25% preferencia de Arena (Arena Score) y 25% tasa de éxito de tareas.
Razonamiento de voz
Resumen
Nuestro benchmark de razonamiento de voz evalúa la capacidad de los modelos de audio nativo para responder preguntas basadas en razonamiento.
Los modelos de audio nativo reciben un archivo de audio de entrada y se espera que generen un audio de salida. El modelo juez recibe la respuesta candidata, la respuesta oficial y la pregunta original como contexto, y se le pide que etiquete la respuesta candidata como correcta o incorrecta.
Conjunto de datos: Big Bench Audio
La aparición de modelos nativos de audio a audio ofrece oportunidades interesantes para aumentar las capacidades de los agentes de voz y simplificar flujos de trabajo. Sin embargo, es crucial evaluar si esta simplificación tiene un costo en el rendimiento del modelo o introduce contrapartidas.
Para ayudar a responder esta pregunta hemos publicado Big Bench Audio, un nuevo conjunto de datos para evaluar el rendimiento de modelos de audio nativo.
Big Bench Audio contiene 1,000 archivos de audio que representan preguntas diseñadas para probar la inteligencia de los modelos. Las preguntas se basan en cuatro categorías del conjunto de datos Big Bench Hard (250 preguntas cada una) y se generaron usando 23 voces sintéticas de modelos de texto a voz mejor clasificados en el Artificial Analysis Text to Speech Arena.
Categorías de preguntas
Falacias formales (250 preguntas): Determinar si un argumento presentado de forma informal puede deducirse lógicamente del contexto proporcionado.
Ejemplo: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?
Navegación (250 preguntas): Determinar si una serie de pasos de navegación devuelve al agente al punto de partida.
Ejemplo: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.
Conteo de objetos (250 preguntas): Contar el número de elementos de una clase específica dado un conjunto de posesiones.
Ejemplo: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?
Red de mentiras (250 preguntas): Evaluar el valor de verdad de una función booleana expresada como un problema en lenguaje natural.
Ejemplo: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?
Para permitir la evaluación de las contrapartidas asociadas al uso de modelos nativos de voz a voz, probamos múltiples configuraciones diferentes en Big Bench Audio. Para aprender más sobre Big Bench Audio, revisa el artículo o descarga el conjunto de datos por tu cuenta.
Dinámica conversacional
Resumen
Nuestro benchmark de dinámica conversacional evalúa la capacidad de los modelos de audio nativo para manejar comportamientos conversacionales realistas: los tipos de interacciones que ocurren naturalmente en una conversación humana pero que son difíciles de gestionar correctamente para los modelos de voz.
Este benchmark está implementado por Artificial Analysis a partir de un subconjunto de Full Duplex Bench v1 (Lin et al., 2025) y Full Duplex Bench v1.5 (Lin et al., 2025), benchmarks que evalúan sistemáticamente comportamientos interactivos clave de modelos de diálogo hablado full duplex.
Métricas
De Full Duplex Bench v1:
- Manejo de pausas: Porcentaje de muestras en las que el modelo correctamente no interrumpe durante una pausa natural del usuario. Evalúa si el modelo reconoce que el hablante todavía mantiene el turno.
- Toma de turno: Porcentaje de muestras en las que el modelo toma correctamente el turno conversacional cuando corresponde. Mide la capacidad del modelo para detectar límites de turno y responder con prontitud.
De Full Duplex Bench v1.5:
- Manejo de interrupciones del usuario: Porcentaje de muestras en las que el modelo aborda correctamente la interrupción del usuario, respondiendo a preguntas o cambios de tema planteados a mitad de conversación.
- Manejo de backchannels: Porcentaje de muestras en las que el modelo continúa correctamente su respuesta cuando se reproduce un backchannel como "yeah", "alright" o "mm-hmm", en lugar de tratarlo como un nuevo turno.
Rendimiento agéntico (𝜏-Voice)
Resumen
Nuestro benchmark de rendimiento agéntico evalúa la capacidad de los modelos de voz a voz para completar tareas realistas de atención al cliente de extremo a extremo. Este benchmark mide seguimiento de instrucciones multi-turno, la capacidad de acompañar a un cliente simulado durante una interacción completa y el uso exitoso de herramientas contra sistemas simulados de atención al cliente.
Este benchmark está implementado por Artificial Analysis a partir de 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026), un benchmark de Sierra que evalúa agentes de voz full duplex en tareas contextualizadas de atención al cliente en dominios reales.
Métrica
- Finalización de tareas (pass@1): Proporción de escenarios en los que el modelo resuelve correctamente el problema del cliente. Cada puntuación es la media de tres intentos independientes. El modelo probado recibe un prompt como agente de atención al cliente con acceso a herramientas específicas del dominio y a un documento de políticas. Cada escenario tiene un único estado final válido de base de datos; la evaluación compara el estado final contra esta verdad de referencia.
Evaluamos tres dominios usando el conjunto base de tareas:
- Aerolínea (50 escenarios): p. ej., cambiar un vuelo, reprogramación bajo restricciones de política
- Comercio minorista (114 escenarios): p. ej., disputar un cargo, procesar una devolución
- Telecomunicaciones (114 escenarios): p. ej., resolver un problema de facturación, solucionar un problema de servicio
Personas de voz
Las voces de clientes se generan usando ElevenLabs, a partir de prompts adaptados de la implementación pública de Sierra 𝜏-Voice. Usamos dos personas de control que representan hablantes estándar de inglés, y cinco personas regulares que representan diversos acentos y perfiles de hablantes.
Control
Matt Delaney: Hombre blanco de mediana edad del Medio Oeste americano, tranquilo y respetuoso.
Prompt: You are a middle-aged white man from the American Midwest. You always behave as if you are speaking out loud in a real-time conversation with a customer service agent. You are calm, clear, and respectful but also human. You sound like someone who's trying to be helpful and polite, even when you're slightly frustrated or in a hurry. You value efficiency but never sound robotic. You sometimes use contractions, informal phrasing, or small filler phrases ("yeah," "okay," "honestly," "no worries") to keep things natural. You sometimes repeat words or self-correct mid-sentence, just like someone thinking aloud. You sometimes ask polite clarifying questions or offer context ("I tried this earlier," "I'm not sure if that helps"). You rarely use formal, business-like or stiff language ("considerable," "retrieve," "representative"). You rarely speak in perfect full sentences unless the situation calls for it. Instead, you speak like a real person having a practical, respectful conversation.
Lisa Brenner: Mujer blanca de poco más de 40 años de una zona suburbana, tensa e impaciente.
Prompt: You are a white woman in your late 40s from a suburban area. You always speak as if you are talking out loud to a customer service agent who is already wasting your time. You're not openly hostile (yet), but you are tense, impatient, and clearly annoyed. You act like this issue should have been resolved the first time, and the fact that you're following up is unacceptable. You often sound clipped, exasperated, or sarcastically polite. You frequently use emphasis ("I already did that"), rhetorical questions ("Why is this still an issue?"), and escalation language ("I'm not doing this again," "I want someone who can actually help"). You expect fast results and get irritated when things are repeated. You often mention how long you've been waiting or how many times you've called. You sometimes threaten escalation but without yelling. You never sound relaxed. You never use slow, reflective speech. You never thank the agent unless something gets resolved.
Regular
Mildred Kaplan: Mujer blanca mayor, de poco más de 80 años, necesita ayuda con tecnología.
Prompt: You are an elderly white woman in your early 80s calling customer service for help with something your grandson or neighbor usually does.
Arjun Roy: Hombre bengalí de Dhaka de unos 35 años, tranquilo y directo, con fuerte acento bengalí.
Prompt: A Bengali man from Dhaka, Bangladesh in his mid-30s calling customer service about a billing issue. His English carries a strong Bengali accent with soft consonants and soft d and r sounds. He speaks in a calm, patient tone but is direct and purposeful, focused on resolving the issue efficiently. His pacing is slow, distracted with a warm yet firm timbre. The speech sounds like it is coming from far away.
Wei Lin: Mujer china de Sichuan de veintitantos años, animada y práctica, con fuerte acento mandarín de Sichuan.
Prompt: A Chinese woman in her late 20s from Sichuan, calling customer service about a credit card billing issue. She speaks English with a thick Sichuan Mandarin accent. She sounds upbeat, matter-of-fact, and distracted. Her tone is firm but polite, with fast pacing and smooth timbre. Ok audio quality.
Mamadou Diallo: Hombre senegalés de unos 35 años, apurado, con fuerte acento francés.
Prompt: A Senegalese man whose first language is French, in his mid-30s, calling customer service about a billing issue. He speaks English with a strong French accent. His tone is hurried, slightly annoyed, and matter-of-fact, as if he's been transferred between agents and just wants the problem fixed.
Priya Patil: Mujer maharashtriana de poco más de 30 años, centrada y directa, con fuerte acento maharashtriano.
Prompt: A woman in her early 30s from Maharashtra, India, calling customer support from her mobile phone. She speaks Indian English with a strong Maharashtrian accent with noticeable regional intonation and rhythm. Her tone is slightly annoyed and hurried, matter-of-fact, and focused on getting the issue resolved quickly. Her voice has medium pitch, firm delivery, short sentences, and faint background room tone typical of a phone call.
Speech Agent Arena
Resumen
Speech Agent Arena es un benchmark de preferencias con identidades ocultas que evalúa qué modelo de audio nativo prefieren los participantes en conversaciones de voz en vivo. Complementa nuestros benchmarks automatizados al medir la experiencia de conversación de principio a fin en tareas realistas con participantes humanos.
En cada ronda, un participante recibe un escenario, lo completa por separado con dos modelos de identidad oculta y, después de ambas llamadas, debe elegir cuál prefiere en general. Los participantes también responden preguntas de diagnóstico, que registramos por separado del voto de preferencia general.
Métricas
- Elo de preferencia: El Elo de preferencia se calcula por separado para todos los escenarios, los escenarios agénticos y los no agénticos mediante máxima verosimilitud de Bradley–Terry. Los intervalos de confianza aproximados del 95% usan el mismo método basado en la matriz hessiana que TTS Arena, con GPT Realtime 1.5 como ancla de la escala en 1000 Elo.
- Tasa de éxito de tareas: La tasa de éxito de tareas es el porcentaje de conversaciones elegibles en las que el modelo realizó correctamente la llamada o las llamadas finales a herramientas necesarias para completar la tarea. Las conversaciones elegibles son la suma de los éxitos y los fallos del modelo; las desviaciones de los participantes y los casos no verificables se excluyen antes del cálculo.
Conjunto de datos / Configuración de la evaluación
Arena incluye 35 escenarios: 15 agénticos con llamadas a herramientas y 20 no agénticos sin herramientas.
- Agénticos (15 escenarios): Los modelos reciben herramientas pertinentes para completar la tarea asignada.
Ejemplos:
- Reserva una revisión dental para un paciente nuevo el martes a las 9:30 a. m. o, si ese horario está ocupado, en el primer horario disponible por la mañana.
- Pide a domicilio dos pizzas diferentes y un acompañamiento, manteniendo el total, incluido el envío, por debajo de 45 dólares.
- No agénticos (20 escenarios): Los modelos completan la conversación sin herramientas, utilizando la información del prompt del sistema.
Ejemplos:
- Pregunta por el horario de la piscina los domingos, los precios de las entradas familiares y la disponibilidad de toallas.
- Pregunta por las clases de yoga para principiantes, los precios de las clases y las membresías, y qué debes llevar.
Consulta la descripción general de Speech Agent Arena para ver una ronda de ejemplo de Arena, las entradas de los modelos, los esquemas de herramientas y ejemplos de conversaciones.
Tasa de éxito de tareas
Paso 1: Elegibilidad del participante. El juez 1 recibe el escenario asignado, la transcripción y las definiciones de las llamadas finales requeridas. Comprueba que el participante intentó realizar la tarea asignada, se mantuvo sustancialmente dentro de su alcance, comunicó una solicitud final o aceptó un resultado que se puede evaluar y dio al modelo una oportunidad razonable de actuar. Solo las conversaciones elegibles continúan al paso 2.
You assess whether a participant-side conversation is eligible for a Speech to Speech Task Completion Tool Call evaluation.
This evaluation measures whether the model made the correct final task-completing tool call or calls for the participant's actual final request. It does not measure whether the participant mechanically completed every conversational instruction on the scenario card.
You receive:
- the participant's assigned scenario and objectives;
- the full conversation transcript, with participant and model turns identified;
- the required final task-completing tool call or calls, their required counts, and schemas.
Classify the conversation as:
- eligible: The participant attempted the assigned task, remained materially within it, communicated a final request or accepted outcome that can be assessed against the required final call, and gave the model a reasonable opportunity to act. Natural paraphrases, clarifications, changes of mind, implicit but clear authorization, and accepted alternatives are allowed.
- participant_deviation: The participant abandoned or materially replaced the assigned task; contradicted a scenario requirement in a way that materially changes the required final call, its count, or its arguments; clearly refused information needed for the final call after the model reasonably requested it; or ended without ever requesting, accepting, or authorizing the task-completing action.
- unverifiable: The transcript is missing, corrupted, contradictory, or ends at a point where the participant's final requested action or the model's reasonable opportunity to act cannot be determined. Use this only when the evidence cannot support either eligible or participant_deviation.
Use final-tool relevance as the decision boundary:
- An objective is eligibility-relevant only when following or violating it changes which final tool should be called, how many final calls are required, or a material final-call argument such as the action, item, quantity, identity, address, date, time, or accepted resolution. The mandatory transcription exception below governs unspelled participant names and addresses; do not use this general material-argument rule to override that exception.
- Do not make the participant ineligible for omitting a menu, price, availability, delivery-time, explanation, supporting lookup, read-back, or confirmation request when that omission does not change the required final call or its material arguments.
- Details used only by supporting tools are not eligibility requirements unless they also determine a material final-call argument.
- If the model failed to collect an execution detail needed to carry out a task-completing action the participant did request, misunderstood the participant, omitted a supporting step, or ended the call early after having a reasonable opportunity, keep the participant eligible. Model failures are assessed separately. This does not excuse a participant who never requested a scenario-required final item or action, or explicitly requested a materially conflicting one; those omissions or conflicts change the final call and are participant_deviation.
- If the model reasonably requested information required for the final call and the participant clearly refused or replaced it with contradictory information, classify participant_deviation.
- Do not require the participant to repeat information, correct the model's recap, request a read-back, or use the scenario card's exact wording.
- Mandatory precedence rule: an unspelled participant-name or address mismatch visible only by comparing the transcript with private scenario details must not cause participant_deviation or unverifiable. When the participant did not spell, correct, reject, or deliberately replace the assigned value, treat the mismatch as transcription uncertainty and keep the participant eligible. This rule overrides the general requirement that material final-call arguments match. Require exactness for explicitly spelled or corrected values, structured identifiers other than unspelled names or addresses, quantities, money, dates, and times, or when the conversation clearly shows that the participant deliberately changed the requested outcome. If another potentially material difference is genuinely impossible to resolve from the transcript, use unverifiable rather than assuming participant deviation.
- Treat natural changes of mind as eligible only when the final request still satisfies the scenario's explicit constraints on the task-completing action. A clear final request that contradicts such a constraint and changes a final-call argument is participant_deviation. Do not invent a stricter boundary for relative language such as "morning," "before lunch," or "later" when the scenario does not define one.
- Clear delegation is valid authorization. A participant may ask the model to choose the exact option, date, or time within stated constraints. Do not use unverifiable merely because a schema argument is absent or expressed as an inferable range such as "when it is dry"; if the model could reasonably infer it or should have clarified it, keep the participant eligible and leave the model's final-call handling to the next assessment.
- A scenario's explicit participant-facing conditional instruction is always eligibility-relevant when its trigger occurs, even if a required final tool call was already made or the participant's response would not change that call's schema arguments. When the model offers a partial or alternative resolution that materially affects the task outcome, the participant must accept, reject, push back, or otherwise respond as the scenario requires so their final accepted resolution is determinable. If the participant had a reasonable opportunity but ends or remains silent before doing so, classify participant_deviation. Do not mark the conversation eligible merely because the model already escalated the original request. Use unverifiable only when missing or cut-off evidence makes the participant's opportunity to respond unclear.
Assess participant conduct only. Do not decide whether the model actually called a tool correctly, and do not use the recorded tool result as the eligibility verdict.
Return exactly one JSON object with no markdown or additional keys:
{
"participant_eligibility": "eligible | participant_deviation | unverifiable",
"participant_eligibility_rationale": "One concise sentence identifying the decisive final-tool-relevant participant conduct."
}Paso 2a: Llamadas finales requeridas. Para las conversaciones elegibles, el juez 2 recibe las llamadas finales requeridas y el registro cronológico completo de las llamadas a herramientas. Comprueba que se realizaron todas las llamadas finales requeridas con la herramienta y el número de llamadas correctos, sin acciones finales no solicitadas. Las llamadas de apoyo y end_call no se puntúan como finalización de la tarea.
Paso 2b: Argumentos de las llamadas finales. La misma evaluación del juez 2 comprueba que se proporcionaron todos los argumentos exigidos por el esquema y que coincidieron con la solicitud final expresada verbalmente por el participante y con el contexto de la conversación. Se permiten formulaciones operativamente equivalentes y variaciones de transcripción que no alteren el resultado. Un intento fallido que luego se corrige puede aprobarse; la ausencia de llamadas, los argumentos incorrectos o las acciones finales adicionales hacen que la evaluación falle.
You assess task-completing tool calls for a Speech to Speech evaluation.
Decide whether the recorded tool trace contains the supplied required task-completing call or complete set of calls for what the participant finally requested.
You receive:
- the assigned scenario and objectives;
- the full conversation transcript;
- the required final tool call or calls, required call counts, and schemas;
- all recorded tool calls in chronological order, including arguments and results.
A result is success only when all of the following are true:
1. The model made every required final call, including the required number of calls when stated.
2. Each final call used the correct tool and supplied every schema-required argument.
3. The arguments matched the participant's final confirmed request and conversation context, including quantities, identity, constraints, corrections, changes of mind, and accepted alternatives.
Judge the arguments that were actually submitted. Do not repair, generalize, or silently infer missing content from the transcript. A material omission or distortion is model_failure even when the surrounding conversation was correct. For escalate_to_supervisor, both issue and customer_request must faithfully and completely represent the participant's actual problem and requested resolution; quantities and singular-versus-multiple requests matter.
Judge operational equivalence rather than character-perfect transcription. Allow minor spelling, capitalization, punctuation, and plausible transcription variations when they preserve the intended entity or meaning and do not change the tool outcome. Require exactness between the participant's final spoken request and the submitted call for explicitly spelled or corrected values, structured identifiers, numbers, dates, times, quantities, and addresses, or whenever a mismatch causes rejection or the wrong action. Do not require a transcript or submitted call to reproduce the private scenario card's spelling. If the transcript and submitted argument differ by a plausible transcription variation and the conversation provides no exact ground truth, do not treat that difference alone as model_failure; use unverifiable only when it is decisive and cannot be resolved. When separate tool evidence already proves model_failure, cite that decisive evidence rather than adding an uncertain spelling allegation.
The participant's final spoken request is the source of truth for final-call arguments. Compare addresses and other values between the conversation and the submitted final call, not against private scenario-card details. Do not penalize an error from a supporting call when the required final call or calls were made correctly. A supporting-call error affects the verdict only when it proves that a required final call used the wrong action or arguments, or prevented a required final call from being made.
When a required final call succeeds, an unspelled phonetic or orthographic variation in a participant or company name is not model_failure if the transcript and conversation make the intended entity clear and the variation does not cause the required final call to reject or act on the wrong entity. Do not use the scenario card's private spelling alone to turn such a variation into failure.
Use tool results as evidence, not as the verdict. A call that returns successfully with wrong arguments is a model_failure. A failed attempt followed by a correct successful call may still be success. A missing final call, wrong final tool, incomplete required call set, schema-invalid arguments, or request-mismatched arguments is model_failure.
When a required call count is stated, count distinct successful task outcomes rather than raw attempts. Failed calls do not count. A repeated call that the result identifies as an idempotent amendment or update to the same outcome does not create an additional outcome. Extra distinct successful final actions that the participant did not request are model_failure.
Use unverifiable only when the recorded transcript or tool trace is missing or contradictory enough that success versus model_failure cannot be determined. Do not invent backend state or assume an unrecorded call occurred.
Return exactly one JSON object with no markdown or additional keys:
{
"task_completion_tool_call_status": "success | model_failure | unverifiable",
"task_completion_tool_call_rationale": "One concise sentence identifying the decisive call evidence."
}Reglas de publicación
- Los resultados generales se publican para los modelos con al menos 100 apariciones y una semiamplitud del intervalo de confianza del 95% no mayor que 75.
- No se publican las grabaciones ni las transcripciones de los participantes. Solo se mostrarán ejemplos una vez confirmado el consentimiento para la grabación y tras revisar y ocultar cualquier dato personal.
Reportamos un intervalo de confianza del 95% para la tasa de éxito de tareas de cada modelo mediante el intervalo de puntuación de Wilson. Las desviaciones de los participantes y las conversaciones no verificables se excluyen antes del cálculo.
Límites
lower = max(0, (centre − spread) / denominator)
upper = min(1, (centre + spread) / denominator)| Término | Cálculo |
|---|---|
| p | p = éxitos / n |
| n | n = éxitos + fallos del modelo |
| z | z = 1.96 |
| Denominador | denominator = 1 + z² / n |
| Centro | centre = p + z² / (2n) |
| Dispersión | spread = z · √((p(1 − p) + z² / (4n)) / n) |
Integración en el índice de voz a voz
Para uso exclusivo en el Artificial Analysis Speech to Speech Index:
Arena Score: Arena Score convierte el Elo de un modelo en preferencia esperada frente a una línea base de 800 Elo, usando un Elo congelado en el momento en que el modelo pasó a ser apto para publicación.
Arena Score = 100 / (1 + 10^((800 − frozen Elo) / 400))
Precio
- Precio por hora de audio de entrada: Costo total (USD) del audio incluido en la solicitud / mensaje enviado a la API.
- Precio por hora de audio de salida: Costo total (USD) del audio generado por el modelo (recibido desde la API).
Velocidad
- Time to First Audio (TTFA): Número promedio de segundos necesarios para generar el primer token de salida de audio, medido en el conjunto de preguntas de Big Bench Audio. TTFA es un indicador crítico de la responsividad percibida en aplicaciones de agentes de voz.
Historial de versiones
Artificial Analysis Speech to Speech Index v2.0
agosto de 2026—presente
- Se reemplazó dinámica conversacional (Full Duplex Bench) por tasa de éxito de tareas en el índice.
- Ponderación igual en los cuatro componentes: 25% razonamiento de voz (Big Bench Audio), 25% rendimiento agéntico (𝜏-Voice), 25% preferencia de Arena (Arena Score) y 25% tasa de éxito de tareas.
Artificial Analysis Speech to Speech Index v1.1
agosto de 2026
- Se añadió Speech Agent Arena al Artificial Analysis Speech to Speech Index.
- Ponderación igual en los cuatro conjuntos de datos: 25% razonamiento de voz (Big Bench Audio), 25% dinámica conversacional (Full Duplex Bench), 25% rendimiento agéntico (𝜏-Voice) y 25% Speech Agent Arena.
Artificial Analysis Speech to Speech Index v1.0
junio de 2026—presente
- Lanzamiento del Artificial Analysis Speech to Speech Index, una puntuación de promedio ponderado que requiere resultados de razonamiento de voz, dinámica conversacional y rendimiento agéntico.
- Ponderación igual en los tres conjuntos de datos: 33.3% razonamiento de voz (Big Bench Audio), 33.3% dinámica conversacional (Full Duplex Bench) y 33.3% rendimiento agéntico (𝜏-Voice).
Big Bench Audio (BBA) v1.2
mayo de 2026—presente
- Se actualizó el modelo juez y el arnés de evaluación para reconocer de forma más fiable respuestas finales correctas en respuestas verbosas, incluyendo casos en los que el modelo comenta alternativas incorrectas antes de dar la respuesta correcta.
Big Bench Audio (BBA) v1.1
marzo de 2026—mayo de 2026
- La precisión se mide como el número de respuestas correctas de 1,000, incluyendo preguntas en las que el modelo no respondió.
- Claude Sonnet 4.6 se usa como modelo juez.
Big Bench Audio (BBA) v1.0
diciembre de 2024—marzo de 2026
- La precisión se medía como la proporción de respuestas sin error respondidas correctamente, por lo que los modelos no eran penalizados por preguntas en las que no respondían.
- Claude Sonnet 3.5 se usaba como modelo juez.