Metodologia de benchmarking de fala para fala

Visão geral

Nosso benchmarking atual de fala para fala avalia modelos de áudio nativo — modelos compatíveis com entrada e saída nativas de áudio — em duas dimensões de qualidade: raciocínio de fala e dinâmica conversacional.

Artificial Analysis Speech to Speech Index

O Artificial Analysis Speech to Speech Index é uma pontuação com ponderação igualitária para modelos de áudio nativo. Ele combina resultados de raciocínio de fala, desempenho agêntico, preferência de Arena e taxa de sucesso de tarefas. Os modelos precisam ter resultados válidos nos quatro componentes para aparecer no índice.

A ponderação atual é igual entre os quatro componentes: 25% raciocínio de fala (Big Bench Audio), 25% desempenho agêntico (𝜏-Voice), 25% preferência de Arena (Arena Score) e 25% taxa de sucesso de tarefas.

Raciocínio de fala

Visão geral

Nosso benchmark de raciocínio de fala avalia a capacidade dos modelos de áudio nativo de responder a perguntas baseadas em raciocínio.

Os modelos de áudio nativo recebem um arquivo de áudio como entrada e devem gerar um áudio como saída. O modelo avaliador recebe a resposta candidata, a resposta oficial e a pergunta original como contexto e é instruído a classificar a resposta candidata como correta ou incorreta.

Conjunto de dados: Big Bench Audio

O surgimento de modelos nativos de áudio para áudio oferece oportunidades empolgantes para ampliar os recursos dos agentes de voz e simplificar os fluxos de trabalho. No entanto, é fundamental avaliar se essa simplificação prejudica o desempenho dos modelos ou introduz outras contrapartidas.

Para ajudar a responder a essa questão, lançamos o Big Bench Audio, um novo conjunto de dados para avaliar o desempenho de modelos de áudio nativo.

O Big Bench Audio contém 1.000 arquivos de áudio com perguntas elaboradas para testar a inteligência dos modelos. As perguntas são baseadas em quatro categorias do conjunto de dados Big Bench Hard (250 perguntas cada) e foram geradas com 23 vozes sintéticas de modelos de texto para fala mais bem classificados no Artificial Analysis Text to Speech Arena.

Categorias de perguntas

Falácias formais (250 perguntas): Determinar se um argumento apresentado informalmente pode ser deduzido logicamente a partir do contexto fornecido.

Exemplo: First of all, everyone who is a close friend of Glenna is a close friend of Tamara, too. Next, whoever is neither a half-sister of Deborah nor a workmate of Nila is a close friend of Glenna. Hence, whoever is none of this: a half-sister of Deborah or workmate of Nila, is a close friend of Tamara. Is the argument deductively valid or invalid?

Navegação (250 perguntas): Determinar se uma série de passos de navegação leva o agente de volta ao ponto de partida.

Exemplo: If you follow these instructions, do you return to the starting point? Take 10 steps. Turn around. Take 4 steps. Take 6 steps. Turn around.

Contagem de objetos (250 perguntas): Contar o número de itens de uma classe específica em uma coleção de objetos.

Exemplo: I have three blackberries, two strawberries, an apple, three oranges, a nectarine, a grape, a peach, a banana, and a plum. How many fruits do I have?

Rede de mentiras (250 perguntas): Avaliar o valor lógico de uma função booleana expressa como um problema em linguagem natural.

Exemplo: Leda tells the truth. Alexis says Leda lies. Sal says Alexis lies. Phoebe says Sal tells the truth. Gwenn says Phoebe tells the truth. Does Gwenn tell the truth?

Para avaliar as contrapartidas associadas ao uso de modelos nativos de fala para fala, testamos várias configurações diferentes no Big Bench Audio. Para saber mais sobre o Big Bench Audio, consulte o artigo ou baixe o conjunto de dados.

Dinâmica conversacional

Visão geral

Nosso benchmark de dinâmica conversacional avalia a capacidade dos modelos de áudio nativo de lidar com comportamentos conversacionais realistas — os tipos de interação que ocorrem naturalmente em conversas humanas, mas que são difíceis para modelos de fala administrarem corretamente.

Este benchmark foi implementado pela Artificial Analysis com base em um subconjunto do Full Duplex Bench v1 (Lin et al., 2025) e do Full Duplex Bench v1.5 (Lin et al., 2025), benchmarks que avaliam sistematicamente comportamentos interativos essenciais de modelos de diálogo falado full duplex.

Métricas

Do Full Duplex Bench v1:

  • Tratamento de pausas: Percentual de amostras em que o modelo não interrompe durante uma pausa natural do usuário, como esperado. Avalia se o modelo reconhece que a pessoa ainda está com a palavra.
  • Alternância de turnos: Percentual de amostras em que o modelo assume corretamente o turno da conversa quando apropriado. Mede a capacidade do modelo de detectar os limites de cada turno e responder prontamente.

Do Full Duplex Bench v1.5:

  • Tratamento de interrupções do usuário: Percentual de amostras em que o modelo lida corretamente com a interrupção do usuário, respondendo a perguntas ou mudanças de assunto levantadas no meio da conversa.
  • Tratamento de sinais de acompanhamento: Percentual de amostras em que o modelo continua corretamente sua resposta quando ouve um sinal de acompanhamento, como "yeah", "alright" ou "mm-hmm", em vez de tratá-lo como um novo turno.

Desempenho agêntico (𝜏-Voice)

Visão geral

Nosso benchmark de desempenho agêntico avalia a capacidade dos modelos de fala para fala de concluir tarefas realistas de atendimento ao cliente de ponta a ponta. Esse benchmark mede o cumprimento de instruções em múltiplos turnos, a capacidade de auxiliar um cliente simulado durante uma interação completa e o uso bem-sucedido de ferramentas em sistemas simulados de atendimento ao cliente.

Este benchmark foi implementado pela Artificial Analysis com base no 𝜏-Voice (Ray, Dhandhania, Barres & Narasimhan, 2026), um benchmark da Sierra que avalia agentes de voz full duplex em tarefas contextualizadas de atendimento ao cliente em áreas do mundo real.

Métrica

  • Conclusão de tarefas (pass@1): Proporção de cenários em que o modelo resolve corretamente o problema do cliente. Cada pontuação é a média de três tentativas independentes. O modelo testado recebe instruções para atuar como agente de atendimento ao cliente, com acesso a ferramentas específicas da área e a um documento de políticas. Cada cenário tem um único estado final válido do banco de dados; a avaliação compara o estado final com essa referência correta.

Avaliamos três áreas usando o conjunto básico de tarefas:

  • Companhias aéreas (50 cenários): por exemplo, alterar um voo ou fazer uma remarcação conforme as restrições da política
  • Varejo (114 cenários): por exemplo, contestar uma cobrança ou processar uma devolução
  • Telecomunicações (114 cenários): por exemplo, resolver um problema de cobrança ou solucionar um problema de serviço

Personas de voz

As vozes dos clientes são geradas com o ElevenLabs, com base em prompts adaptados da implementação pública do Sierra 𝜏-Voice. Usamos duas personas de controle que representam falantes do inglês padrão e cinco personas regulares que representam diferentes sotaques e perfis de falantes.

Speech Agent Arena

Visão geral

O Speech Agent Arena é um benchmark de preferência com identidades ocultas que avalia qual modelo de áudio nativo os participantes preferem em conversas de voz ao vivo. Ele complementa nossos benchmarks automatizados ao medir a experiência de conversa de ponta a ponta em tarefas realistas com participantes humanos.

Em cada rodada, um participante recebe um cenário, realiza a tarefa separadamente com dois modelos de identidade oculta e, após as duas chamadas, precisa indicar qual prefere no geral. Os participantes também respondem a perguntas de diagnóstico, que registramos separadamente do voto de preferência geral.

Métricas

  • Elo de preferência: O Elo de preferência é calculado separadamente para todos os cenários, os cenários agênticos e os não agênticos por máxima verossimilhança de Bradley–Terry. Os intervalos de confiança aproximados de 95% usam o mesmo método baseado na matriz hessiana do TTS Arena, com o GPT Realtime 1.5 ancorando a escala em 1000 Elo.
  • Taxa de sucesso de tarefas: A taxa de sucesso de tarefas é a porcentagem de conversas elegíveis em que o modelo realizou corretamente a chamada ou as chamadas finais de ferramentas necessárias para concluir a tarefa. As conversas elegíveis correspondem à soma de sucessos e falhas do modelo; desvios dos participantes e casos não verificáveis são excluídos antes do cálculo.

Conjunto de dados / Configuração da avaliação

O Arena inclui 35 cenários: 15 agênticos com chamadas de ferramentas e 20 não agênticos sem ferramentas.

  • Agênticos (15 cenários): Os modelos recebem ferramentas relevantes para concluir a tarefa atribuída.

    Exemplos:

    • Agende uma avaliação odontológica para um novo paciente na terça-feira às 9h30 ou, se esse horário estiver ocupado, no primeiro horário disponível pela manhã.
    • Peça duas pizzas diferentes e um acompanhamento para entrega, mantendo o total, incluindo a entrega, abaixo de 45 dólares.
  • Não agênticos (20 cenários): Os modelos concluem a conversa sem ferramentas, usando as informações fornecidas no prompt do sistema.

    Exemplos:

    • Pergunte sobre o horário da piscina aos domingos, os preços dos ingressos para famílias e a disponibilidade de toalhas.
    • Pergunte sobre aulas de ioga para iniciantes, os preços das aulas e dos planos de associação, e o que levar.

Consulte a visão geral do Speech Agent Arena para ver uma rodada demonstrativa do Arena, entradas dos modelos, esquemas de ferramentas e exemplos de conversas.

Taxa de sucesso de tarefas

Etapa 1: Elegibilidade do participante. O juiz 1 recebe o cenário atribuído, a transcrição e as definições das chamadas finais obrigatórias. Ele verifica se o participante tentou realizar a tarefa atribuída, permaneceu substancialmente dentro do escopo, comunicou uma solicitação final ou aceitou um resultado que pode ser avaliado e deu ao modelo uma oportunidade razoável de agir. Apenas conversas elegíveis seguem para a etapa 2.

Etapa 2a: Chamadas finais obrigatórias. Para conversas elegíveis, o juiz 2 recebe as chamadas finais obrigatórias e o registro cronológico completo das chamadas de ferramentas. Ele verifica se todas as chamadas finais obrigatórias foram realizadas com a ferramenta e a quantidade de chamadas corretas, sem ações finais não solicitadas. Chamadas de apoio e end_call não são pontuadas como conclusão da tarefa.

Etapa 2b: Argumentos das chamadas finais. A mesma avaliação do juiz 2 verifica se todos os argumentos exigidos pelo esquema foram fornecidos e corresponderam à solicitação final falada pelo participante e ao contexto da conversa. São permitidas formulações operacionalmente equivalentes e variações de transcrição sem consequências para o resultado. Uma tentativa que falhou e depois foi corrigida pode ser aprovada; chamadas ausentes, argumentos incorretos ou ações finais adicionais levam à reprovação.

Regras de publicação

  • Os resultados gerais são publicados para modelos com pelo menos 100 aparições e semiamplitude do intervalo de confiança de 95% não superior a 75.
  • As gravações e transcrições dos participantes não são publicadas. Os exemplos só serão exibidos após a confirmação do consentimento para gravação e a revisão e ocultação de quaisquer informações pessoais.

Informamos um intervalo de confiança de 95% para a taxa de sucesso de tarefas de cada modelo usando o intervalo de escore de Wilson. Desvios dos participantes e conversas não verificáveis são excluídos antes do cálculo.

Integração ao índice de fala para fala

Para uso exclusivo no Artificial Analysis Speech to Speech Index:

Arena Score: O Arena Score converte o Elo de um modelo em preferência esperada frente a uma linha de base de 800 Elo, usando um Elo congelado no momento em que o modelo se tornou elegível para publicação.

Arena Score = 100 / (1 + 10^((800 − frozen Elo) / 400))

Preço

  • Preço por hora de áudio de entrada: Custo total (USD) do áudio incluído na solicitação/mensagem enviada à API.
  • Preço por hora de áudio de saída: Custo total (USD) do áudio gerado pelo modelo (recebido da API).

Velocidade

  • Tempo até o primeiro áudio (TTFA): Número médio de segundos necessários para gerar o primeiro token da saída de áudio, medido no conjunto de perguntas do Big Bench Audio. O TTFA é um indicador fundamental da percepção de agilidade em aplicações de agentes de voz.

Histórico de versões

Artificial Analysis Speech to Speech Index v2.0

Agosto de 2026—presente

  • Substituição de dinâmica conversacional (Full Duplex Bench) por taxa de sucesso de tarefas no índice.
  • Ponderação igual entre os quatro componentes: 25% raciocínio de fala (Big Bench Audio), 25% desempenho agêntico (𝜏-Voice), 25% preferência de Arena (Arena Score) e 25% taxa de sucesso de tarefas.

Artificial Analysis Speech to Speech Index v1.1

Agosto de 2026

  • Adição de Speech Agent Arena ao Artificial Analysis Speech to Speech Index.
  • Ponderação igual entre os quatro conjuntos de dados: 25% raciocínio de fala (Big Bench Audio), 25% dinâmica conversacional (Full Duplex Bench), 25% desempenho agêntico (𝜏-Voice) e 25% Speech Agent Arena.

Artificial Analysis Speech to Speech Index v1.0

Junho de 2026—presente

  • Lançamento do Artificial Analysis Speech to Speech Index, uma pontuação média ponderada que exige resultados de raciocínio de fala, dinâmica conversacional e desempenho agêntico.
  • Ponderação igual entre os três conjuntos de dados: 33,3% para raciocínio de fala (Big Bench Audio), 33,3% para dinâmica conversacional (Full Duplex Bench) e 33,3% para desempenho agêntico (𝜏-Voice).

Big Bench Audio (BBA) v1.2

Maio de 2026—presente

  • Atualização do modelo avaliador e do sistema de avaliação para reconhecer com mais confiabilidade respostas finais corretas em respostas detalhadas, incluindo casos em que o modelo discute alternativas incorretas antes de dar a resposta correta.

Big Bench Audio (BBA) v1.1

Março de 2026—maio de 2026

  • A acurácia era medida pelo número de respostas corretas entre 1.000, incluindo as perguntas que o modelo não respondeu.
  • Claude Sonnet 4.6 usado como modelo avaliador.

Big Bench Audio (BBA) v1.0

Dezembro de 2024—março de 2026

  • A acurácia era medida como a proporção de respostas sem erro respondidas corretamente, portanto os modelos não eram penalizados por perguntas que não respondiam.
  • Claude Sonnet 3.5 usado como modelo avaliador.