Metodologia de benchmarking de fala para fala
Visão geral
Nosso benchmarking atual de fala para fala avalia modelos de áudio nativo — modelos compatíveis com entrada e saída nativas de áudio — em duas dimensões de qualidade: raciocínio de fala e dinâmica conversacional.
Artificial Analysis Speech to Speech Index
O Artificial Analysis Speech to Speech Index é uma pontuação média ponderada para modelos de áudio nativo. Ele combina resultados de raciocínio de fala, dinâmica conversacional e desempenho agêntico. Os modelos precisam ter resultados válidos nos três conjuntos de dados para aparecer no índice.
A ponderação atual é igual entre os três conjuntos de dados: 33,3% para raciocínio de fala (Big Bench Audio), 33,3% para dinâmica conversacional (Full Duplex Bench) e 33,3% para desempenho agêntico (𝜏-Voice).
Raciocínio de fala
Visão geral
Nosso benchmark de raciocínio de fala avalia a capacidade dos modelos de áudio nativo de responder a perguntas baseadas em raciocínio.
Os modelos de áudio nativo recebem um arquivo de áudio como entrada e devem gerar um áudio como saída. O modelo avaliador recebe a resposta candidata, a resposta oficial e a pergunta original como contexto e é instruído a classificar a resposta candidata como correta ou incorreta.
Conjunto de dados: Big Bench Audio
O surgimento de modelos nativos de áudio para áudio oferece oportunidades empolgantes para ampliar os recursos dos agentes de voz e simplificar os fluxos de trabalho. No entanto, é fundamental avaliar se essa simplificação prejudica o desempenho dos modelos ou introduz outras contrapartidas.
Para ajudar a responder a essa questão, lançamos o Big Bench Audio, um novo conjunto de dados para avaliar o desempenho de modelos de áudio nativo.
O Big Bench Audio contém 1.000 arquivos de áudio com perguntas elaboradas para testar a inteligência dos modelos. As perguntas são baseadas em quatro categorias do conjunto de dados Big Bench Hard (250 perguntas cada) e foram geradas com 23 vozes sintéticas de modelos de texto para fala mais bem classificados no Artificial Analysis Text to Speech Arena.
Categorias de perguntas
Falácias formais (250 perguntas): Determinar se um argumento apresentado informalmente pode ser deduzido logicamente a partir do contexto fornecido.
Exemplo: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?
Navegação (250 perguntas): Determinar se uma série de passos de navegação leva o agente de volta ao ponto de partida.
Exemplo: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.
Contagem de objetos (250 perguntas): Contar o número de itens de uma classe específica em uma coleção de objetos.
Exemplo: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?
Rede de mentiras (250 perguntas): Avaliar o valor lógico de uma função booleana expressa como um problema em linguagem natural.
Exemplo: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?
Para avaliar as contrapartidas associadas ao uso de modelos nativos de fala para fala, testamos várias configurações diferentes no Big Bench Audio. Para saber mais sobre o Big Bench Audio, consulte o artigo ou baixe o conjunto de dados.
Dinâmica conversacional
Visão geral
Nosso benchmark de dinâmica conversacional avalia a capacidade dos modelos de áudio nativo de lidar com comportamentos conversacionais realistas — os tipos de interação que ocorrem naturalmente em conversas humanas, mas que são difíceis para modelos de fala administrarem corretamente.
Este benchmark foi implementado pela Artificial Analysis com base em um subconjunto do Full Duplex Bench v1 (Lin et al., 2025) e do Full Duplex Bench v1.5 (Lin et al., 2025), benchmarks que avaliam sistematicamente comportamentos interativos essenciais de modelos de diálogo falado full duplex.
Métricas
Do Full Duplex Bench v1:
- Tratamento de pausas: Percentual de amostras em que o modelo não interrompe durante uma pausa natural do usuário, como esperado. Avalia se o modelo reconhece que a pessoa ainda está com a palavra.
- Alternância de turnos: Percentual de amostras em que o modelo assume corretamente o turno da conversa quando apropriado. Mede a capacidade do modelo de detectar os limites de cada turno e responder prontamente.
Do Full Duplex Bench v1.5:
- Tratamento de interrupções do usuário: Percentual de amostras em que o modelo lida corretamente com a interrupção do usuário, respondendo a perguntas ou mudanças de assunto levantadas no meio da conversa.
- Tratamento de sinais de acompanhamento: Percentual de amostras em que o modelo continua corretamente sua resposta quando ouve um sinal de acompanhamento, como "yeah", "alright" ou "mm-hmm", em vez de tratá-lo como um novo turno.
Desempenho agêntico (𝜏-Voice)
Visão geral
Nosso benchmark de desempenho agêntico avalia a capacidade dos modelos de fala para fala de concluir tarefas realistas de atendimento ao cliente de ponta a ponta. Esse benchmark mede o cumprimento de instruções em múltiplos turnos, a capacidade de auxiliar um cliente simulado durante uma interação completa e o uso bem-sucedido de ferramentas em sistemas simulados de atendimento ao cliente.
Este benchmark foi implementado pela Artificial Analysis com base no 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026), um benchmark da Sierra que avalia agentes de voz full duplex em tarefas contextualizadas de atendimento ao cliente em áreas do mundo real.
Métrica
- Conclusão de tarefas (pass@1): Proporção de cenários em que o modelo resolve corretamente o problema do cliente. Cada pontuação é a média de três tentativas independentes. O modelo testado recebe instruções para atuar como agente de atendimento ao cliente, com acesso a ferramentas específicas da área e a um documento de políticas. Cada cenário tem um único estado final válido do banco de dados; a avaliação compara o estado final com essa referência correta.
Avaliamos três áreas usando o conjunto básico de tarefas:
- Companhias aéreas (50 cenários): por exemplo, alterar um voo ou fazer uma remarcação conforme as restrições da política
- Varejo (114 cenários): por exemplo, contestar uma cobrança ou processar uma devolução
- Telecomunicações (114 cenários): por exemplo, resolver um problema de cobrança ou solucionar um problema de serviço
Personas de voz
As vozes dos clientes são geradas com o ElevenLabs, com base em prompts adaptados da implementação pública do Sierra 𝜏-Voice. Usamos duas personas de controle que representam falantes do inglês padrão e cinco personas regulares que representam diferentes sotaques e perfis de falantes.
Controle
Matt Delaney: Homem branco de meia-idade do Meio-Oeste dos Estados Unidos, calmo e respeitoso.
Prompt: You are a middle-aged white man from the American Midwest. You always behave as if you are speaking out loud in a real-time conversation with a customer service agent. You are calm, clear, and respectful but also human. You sound like someone who's trying to be helpful and polite, even when you're slightly frustrated or in a hurry. You value efficiency but never sound robotic. You sometimes use contractions, informal phrasing, or small filler phrases ("yeah," "okay," "honestly," "no worries") to keep things natural. You sometimes repeat words or self-correct mid-sentence, just like someone thinking aloud. You sometimes ask polite clarifying questions or offer context ("I tried this earlier," "I'm not sure if that helps"). You rarely use formal, business-like or stiff language ("considerable," "retrieve," "representative"). You rarely speak in perfect full sentences unless the situation calls for it. Instead, you speak like a real person having a practical, respectful conversation.
Lisa Brenner: Mulher branca no fim da faixa dos 40 anos, de uma área suburbana, tensa e impaciente.
Prompt: You are a white woman in your late 40s from a suburban area. You always speak as if you are talking out loud to a customer service agent who is already wasting your time. You're not openly hostile (yet), but you are tense, impatient, and clearly annoyed. You act like this issue should have been resolved the first time, and the fact that you're following up is unacceptable. You often sound clipped, exasperated, or sarcastically polite. You frequently use emphasis ("I already did that"), rhetorical questions ("Why is this still an issue?"), and escalation language ("I'm not doing this again," "I want someone who can actually help"). You expect fast results and get irritated when things are repeated. You often mention how long you've been waiting or how many times you've called. You sometimes threaten escalation but without yelling. You never sound relaxed. You never use slow, reflective speech. You never thank the agent unless something gets resolved.
Regulares
Mildred Kaplan: Mulher branca de pouco mais de 80 anos que precisa de ajuda com tecnologia.
Prompt: You are an elderly white woman in your early 80s calling customer service for help with something your grandson or neighbor usually does.
Arjun Roy: Homem bengali de Daca na faixa dos 30 e poucos anos, calmo e direto, com forte sotaque bengali.
Prompt: A Bengali man from Dhaka, Bangladesh in his mid-30s calling customer service about a billing issue. His English carries a strong Bengali accent with soft consonants and soft d and r sounds. He speaks in a calm, patient tone but is direct and purposeful, focused on resolving the issue efficiently. His pacing is slow, distracted with a warm yet firm timbre. The speech sounds like it is coming from far away.
Wei Lin: Mulher chinesa de Sichuan no fim da faixa dos 20 anos, animada e objetiva, com forte sotaque do mandarim de Sichuan.
Prompt: A Chinese woman in her late 20s from Sichuan, calling customer service about a credit card billing issue. She speaks English with a thick Sichuan Mandarin accent. She sounds upbeat, matter-of-fact, and distracted. Her tone is firm but polite, with fast pacing and smooth timbre. Ok audio quality.
Mamadou Diallo: Homem senegalês na faixa dos 30 e poucos anos, apressado, com forte sotaque francês.
Prompt: A Senegalese man whose first language is French, in his mid-30s, calling customer service about a billing issue. He speaks English with a strong French accent. His tone is hurried, slightly annoyed, and matter-of-fact, as if he's been transferred between agents and just wants the problem fixed.
Priya Patil: Mulher marata de pouco mais de 30 anos, focada e direta, com forte sotaque marata.
Prompt: A woman in her early 30s from Maharashtra, India, calling customer support from her mobile phone. She speaks Indian English with a strong Maharashtrian accent with noticeable regional intonation and rhythm. Her tone is slightly annoyed and hurried, matter-of-fact, and focused on getting the issue resolved quickly. Her voice has medium pitch, firm delivery, short sentences, and faint background room tone typical of a phone call.
Preço
- Preço por hora de áudio de entrada: Custo total (USD) do áudio incluído na solicitação/mensagem enviada à API.
- Preço por hora de áudio de saída: Custo total (USD) do áudio gerado pelo modelo (recebido da API).
Velocidade
- Tempo até o primeiro áudio (TTFA): Número médio de segundos necessários para gerar o primeiro token da saída de áudio, medido no conjunto de perguntas do Big Bench Audio. O TTFA é um indicador fundamental da percepção de agilidade em aplicações de agentes de voz.
Histórico de versões
Artificial Analysis Speech to Speech Index v1.0
Junho de 2026—presente
- Lançamento do Artificial Analysis Speech to Speech Index, uma pontuação média ponderada que exige resultados de raciocínio de fala, dinâmica conversacional e desempenho agêntico.
- Ponderação igual entre os três conjuntos de dados: 33,3% para raciocínio de fala (Big Bench Audio), 33,3% para dinâmica conversacional (Full Duplex Bench) e 33,3% para desempenho agêntico (𝜏-Voice).
Big Bench Audio (BBA) v1.2
Maio de 2026—presente
- Atualização do modelo avaliador e do sistema de avaliação para reconhecer com mais confiabilidade respostas finais corretas em respostas detalhadas, incluindo casos em que o modelo discute alternativas incorretas antes de dar a resposta correta.
Big Bench Audio (BBA) v1.1
Março de 2026—maio de 2026
- A acurácia era medida pelo número de respostas corretas entre 1.000, incluindo as perguntas que o modelo não respondeu.
- Claude Sonnet 4.6 usado como modelo avaliador.
Big Bench Audio (BBA) v1.0
Dezembro de 2024—março de 2026
- A acurácia era medida como a proporção de respostas sem erro respondidas corretamente, portanto os modelos não eram penalizados por perguntas que não respondiam.
- Claude Sonnet 3.5 usado como modelo avaliador.