Ranking da Speech Agent ArenaArtificial Analysis
Compare modelos Speech to Speech por preferência cega em conversas de voz ao vivo sobre temas como marcar consulta odontológica e pedir comida. Para mais detalhes, consulte visão geral e metodologia, ou visite Comparar modelos e provedores para comparar modelos Speech to Speech em outros benchmarks.
Range | Model | Elo | Samples | Task Success Rate | TSR 95% CI | |
|---|---|---|---|---|---|---|
| 1 | 1-2 | Gemini 3.1 Flash Live Minimal | 1096±27Intervalo de 95%: 1068 a 1123 | 841 | 74.6% | 69.4%/79.2% |
| 2 | 1-4 | Gemini 3.8 Live | 1083±30Intervalo de 95%: 1053 a 1113 | 482 | 93.2% | 89.0%/95.8% |
| 3 | 2-5 | Gemini 3.1 Flash Live High | 1063±27Intervalo de 95%: 1036 a 1090 | 813 | 71.8% | 66.4%/76.7% |
| 4 | 3-6 | GPT-Live-1 (Sol, low) | 1053±27Intervalo de 95%: 1026 a 1081 | 652 | 90.9% | 87.2%/93.7% |
| 5 | 3-6 | GPT-Live-1 (Astra, medium) | 1048±28Intervalo de 95%: 1020 a 1076 | 610 | 87.4% | 82.9%/90.8% |
| 6 | 3-9 | Cartesia Line (Default Cascaded System) | 1027±37Intervalo de 95%: 990 a 1064 | 190 | 77.5% | 68.9%/84.3% |
| 7 | 6-10 | Grok Voice Think Fast 2.0 High | 1011±28Intervalo de 95%: 983 a 1038 | 552 | 94.6% | 91.4%/96.7% |
| 8 | 8 | GPT-Realtime-1.5 | 1000ÂncoraFixado em 1000 como ponto de referência da escala Elo deste ranking. | 811 | 85.1% | 80.8%/88.6% |
| 9 | 7-12 | ElevenLabs Agents (Default Cascaded System) | 993±26Intervalo de 95%: 967 a 1020 | 773 | 90.5% | 86.7%/93.4% |
| 10 | 7-12 | Gemini 3.8 Live Extended Thinking (High) | 990±27Intervalo de 95%: 963 a 1017 | 643 | 89.1% | 84.7%/92.4% |
| 11 | 8-12 | GPT Realtime (Aug '25) | 974±26Intervalo de 95%: 948 a 1000 | 797 | 89.4% | 85.2%/92.6% |
| 12 | 9-12 | Nova 2.0 Sonic (Mar 2026) | 974±26Intervalo de 95%: 948 a 1000 | 795 | 57.1% | 51.1%/62.9% |
| 13 | 13-19 | GPT-Realtime-2.1 Minimal | 937±26Intervalo de 95%: 911 a 963 | 798 | 89.4% | 85.2%/92.5% |
| 14 | 13-20 | GPT-Realtime-2 (High) | 932±26Intervalo de 95%: 906 a 958 | 764 | 89.8% | 85.7%/92.9% |
| 15 | 13-20 | GPT-Realtime-2.1 High | 928±26Intervalo de 95%: 902 a 954 | 749 | 91.5% | 87.7%/94.3% |
| 16 | 13-20 | GPT Realtime Mini (Oct '25) | 917±26Intervalo de 95%: 892 a 943 | 830 | 79.6% | 74.6%/83.8% |
| 17 | 13-20 | GPT-Realtime-2 (Minimal) | 916±26Intervalo de 95%: 890 a 941 | 830 | 84.7% | 80.3%/88.3% |
| 18 | 13-20 | Deepgram Voice Agent (Default Cascaded System) | 914±26Intervalo de 95%: 888 a 940 | 817 | 73.7% | 68.5%/78.2% |
| 19 | 13-20 | Nova Sonic | 913±26Intervalo de 95%: 888 a 939 | 827 | 57.1% | 51.6%/62.5% |
| 20 | 14-20 | Grok Voice Think Fast 1.0 | 908±26Intervalo de 95%: 882 a 934 | 864 | 80.7% | 75.8%/84.8% |
| 21 | 21-24 | Inworld Realtime (Default Cascaded System) | 867±26Intervalo de 95%: 841 a 893 | 811 | 69.9% | 64.3%/75.0% |
| 22 | 21-25 | Qwen3.5 Omni Plus Realtime | 859±26Intervalo de 95%: 833 a 886 | 821 | 62.0% | 56.4%/67.2% |
| 23 | 21-25 | Qwen Audio 3.0 Realtime Flash | 850±40Intervalo de 95%: 810 a 889 | 166 | 81.7% | 70.1%/89.4% |
| 24 | 21-25 | Qwen3.5 Omni Flash Realtime | 841±26Intervalo de 95%: 814 a 867 | 847 | 29.1% | 24.0%/34.8% |
| 25 | 22-25 | GPT-Realtime-2.1 Mini Minimal | 840±27Intervalo de 95%: 813 a 867 | 821 | 76.7% | 71.1%/81.4% |
| 26 | 26 | Qwen Audio 3.0 Realtime Plus | 775±44Intervalo de 95%: 731 a 819 | 171 | 77.8% | 66.9%/85.8% |