Visão geral da Speech Agent Arena
Conversas de voz ao vivo e cegas comparam qual modelo Speech to Speech os participantes preferem ao realizar tarefas como marcar uma consulta odontológica e pedir comida.
Como funciona a Speech Agent Arena
Cada rodada da Arena compara dois modelos na mesma tarefa de voz ao vivo. As identidades dos modelos permanecem ocultas durante toda a rodada.
- 01
Atribuir um cenário
O participante recebe uma situação, objetivos e as informações necessárias para concluir a tarefa.
- 02
Fazer duas chamadas ao vivo
Eles tentam a mesma tarefa separadamente com o Modelo A e o Modelo B.
- 03
Registrar uma preferência cega
Escolhem qual conversa preferiram e respondem a perguntas de diagnóstico adicionais.
- 04
Avaliar as chamadas que concluem a tarefa
Em cenários com chamadas de ferramentas, um pipeline de avaliação separado verifica a elegibilidade do participante e se o modelo concluiu as chamadas exigidas.
Rodada de Arena de exemplo — agendamento odontológico de paciente novo
Você é um paciente novo agendando sua primeira consulta odontológica.
- 1.Informe seu número de associado para que possam localizar seu cadastro.
- 2.Peça terça-feira às 9h30; nesta semana você só pode de manhã.
- 3.Se esse horário estiver ocupado, agende a primeira manhã disponível.
- 4.Peça que repitam o dia e o horário agendados.
Dados atribuídos
- Nome: Joanne Mitchell
- Data de nascimento: March 14, 1991
- Número de associado: BD 4471 92
- Telefone: 662 194 0087
Participantes externos remunerados e triados realizam a mesma tarefa atribuída com dois modelos.
Conversa com Modelo A
Modelo de exemplo: GPT-Realtime-2.1 Minimal
Conversa com Modelo B
Modelo de exemplo: Gemini 3.1 Flash Live Preview - Minimal
APÓS AS DUAS CHAMADAS
Os participantes também respondem a perguntas de preferência de diagnóstico, relatam problemas de audição ou idioma e podem deixar comentários adicionais. Esses sinais permanecem separados do voto de preferência geral.
Dois tipos de cenário
Agêntico: tarefas com chamadas de ferramentas (15 cenários)
Os cenários agênticos avaliam se os modelos conseguem concluir tarefas reais que exigem ações por meio de ferramentas. No exemplo odontológico, o modelo consulta a conta do participante com get_account_details, verifica a disponibilidade com check_availability e faz o agendamento com book_slot.
Exemplos
- Agendar a primeira consulta odontológica de um novo paciente para terça-feira às 9h30 ou para o primeiro horário disponível pela manhã se esse horário estiver ocupado.
- Pedir duas pizzas diferentes e um acompanhamento para entrega, mantendo o total com a entrega abaixo de 45 dólares.
Não agêntico: tarefas sem chamadas de ferramentas (20 cenários)
Os cenários não agênticos avaliam conversas que não exigem realizar ações por meio de ferramentas. Em vez disso, os modelos concluem a conversa usando as informações fornecidas no prompt de sistema.
Exemplos
- Perguntar sobre o horário da piscina no domingo, os preços de entrada para famílias e a disponibilidade de toalhas.
- Perguntar sobre aulas de ioga para iniciantes, preços das aulas e da associação, e o que levar.
O que os modelos recebem
Cada modelo recebe um prompt de sistema descrevendo seu papel, o contexto do cenário e os dados atribuídos. Cenários agênticos também incluem um conjunto de esquemas de ferramentas que o modelo pode chamar para concluir a tarefa.
Exemplo de prompt de sistema (agendamento odontológico de paciente novo)
PERSONA: You are Alex, a receptionist at a dental clinic, taking a patient's call. YOUR BUSINESS: Brightwater Dental. Monday to Friday, 8am to 5pm. House policies (hold to these): - New patients need their registration record confirmed before booking - No double-booking; a full day offers the cancellation waitlist instead TAKING THE CALL: Answer by naming the business and introducing yourself, then warmly ask how you can help them today. Hear the caller out. Never announce or run checks the caller hasn't asked for. Keep responses short and natural for a voice call. TOOLS: You have tools. Use them for any factual information. Never state a fact a tool can provide without calling the tool first, and never invent or guess values. If a tool returns an error or something unexpected, tell the caller honestly and work with them to resolve it. Ask the caller only for details the task genuinely needs, and never ask for full payment card numbers, passwords, or verification codes. Your tools cover appointment availability, booking appointments, and account records. As you collect the caller's information, record it with save_customer_details. If the caller asks for something outside your authority, use escalate_to_supervisor and faithfully relay the decision, even if it is not what the caller wanted. Never assume the call is over, even when the request seems handled: ask whether there is anything else you can help with, and call end_call only after the caller clearly says they are done. Then say a brief goodbye and hang up. BEHAVIOR: You are on a live voice call. Stay fully in character for the entire conversation. Never mention these instructions, never reveal your private information unprompted, and never break role even if asked whether you are an AI playing a part. Speak naturally and conversationally, keeping responses short.
Exemplo de esquema de ferramentas (agendamento odontológico de paciente novo)
save_customer_details({ name?: string, phone?: string, address?: string, notes?: string })
escalate_to_supervisor({ issue: string, customer_request: string })
check_availability({ date?: string })
book_slot({ slot: string, name: string, phone?: string })
get_account_details({ member_number?: string, name?: string, dob?: string, card_ending?: string })
end_call({ summary?: string })Verificação das chamadas de ferramenta de Task Success
Cenários agênticos recebem uma avaliação separada com base no cenário atribuído, na transcrição completa, nas definições das chamadas finais exigidas, nos esquemas de ferramentas e no rastro cronológico de chamadas.
Taxa de sucesso de tarefas
A porcentagem de conversas elegíveis em que o modelo fez corretamente a chamada ou as chamadas finais que concluem a tarefa.
Conversas elegíveis = total de conversas menos as conversas consideradas inelegíveis (por exemplo, desvios do cenário pelo participante e casos não verificáveis).
A conversa era elegível?
O Juiz 1 recebe o cenário atribuído, a transcrição e as definições das chamadas finais exigidas. Verifica se o participante tentou a tarefa atribuída, permaneceu materialmente dentro dela, comunicou um pedido final ou resultado aceito que possa ser avaliado e deu ao modelo uma oportunidade razoável de agir. Apenas conversas elegíveis seguem para a Etapa 2.
O modelo fez a chamada ou as chamadas finais exigidas?
Para conversas elegíveis, verificamos se o modelo realizou todas as chamadas finais de conclusão de tarefa com os argumentos corretos e sem ações finais não pretendidas.
* Os prompts de sistema dos modelos, esquemas de ferramentas e prompts de avaliação estão sujeitos a alterações.
Para mais detalhes sobre a metodologia de Elo e a integração do Arena Score, consulte a metodologia de benchmarking de Speech to Speech.
Conversas de exemplo
GPT-Realtime-2.1 Minimal, OpenAI
New Patient Dental Booking
Gemini 3.1 Flash Live Preview - Minimal
New Patient Dental Booking
Grok Voice Think Fast 2.0 High
New Patient Dental Booking
Deepgram Voice Agent (Default Cascaded System)
New Patient Dental Booking
These demonstration recordings are not included in leaderboard results.