Ranking da Speech Agent ArenaArtificial Analysis

Compare modelos Speech to Speech por preferência cega em conversas de voz ao vivo sobre temas como marcar consulta odontológica e pedir comida. Para mais detalhes, consulte visão geral e metodologia, ou visite Comparar modelos e provedores para comparar modelos Speech to Speech em outros benchmarks.

Range
Model
Elo
Samples
Task Success Rate
TSR 95% CI
11-2
Google logo
Gemini 3.1 Flash Live Minimal
1096±27Intervalo de 95%: 1068 a 1123
84174.6%69.4%/79.2%
21-4
Google logo
Gemini 3.8 Live
1083±30Intervalo de 95%: 1053 a 1113
48293.2%89.0%/95.8%
32-5
Google logo
Gemini 3.1 Flash Live High
1063±27Intervalo de 95%: 1036 a 1090
81371.8%66.4%/76.7%
43-6
OpenAI logo
GPT-Live-1 (Sol, low)
1053±27Intervalo de 95%: 1026 a 1081
65290.9%87.2%/93.7%
53-6
OpenAI logo
GPT-Live-1 (Astra, medium)
1048±28Intervalo de 95%: 1020 a 1076
61087.4%82.9%/90.8%
63-9
Cartesia logo
Cartesia Line (Default Cascaded System)
1027±37Intervalo de 95%: 990 a 1064
19077.5%68.9%/84.3%
76-10
SpaceXAI logo
Grok Voice Think Fast 2.0 High
1011±28Intervalo de 95%: 983 a 1038
55294.6%91.4%/96.7%
88
OpenAI logo
GPT-Realtime-1.5
1000ÂncoraFixado em 1000 como ponto de referência da escala Elo deste ranking.
81185.1%80.8%/88.6%
97-12
ElevenLabs logo
ElevenLabs Agents (Default Cascaded System)
993±26Intervalo de 95%: 967 a 1020
77390.5%86.7%/93.4%
107-12
Google logo
Gemini 3.8 Live Extended Thinking (High)
990±27Intervalo de 95%: 963 a 1017
64389.1%84.7%/92.4%
118-12
OpenAI logo
GPT Realtime (Aug '25)
974±26Intervalo de 95%: 948 a 1000
79789.4%85.2%/92.6%
129-12
Amazon Bedrock logo
Nova 2.0 Sonic (Mar 2026)
974±26Intervalo de 95%: 948 a 1000
79557.1%51.1%/62.9%
1313-19
OpenAI logo
GPT-Realtime-2.1 Minimal
937±26Intervalo de 95%: 911 a 963
79889.4%85.2%/92.5%
1413-20
OpenAI logo
GPT-Realtime-2 (High)
932±26Intervalo de 95%: 906 a 958
76489.8%85.7%/92.9%
1513-20
OpenAI logo
GPT-Realtime-2.1 High
928±26Intervalo de 95%: 902 a 954
74991.5%87.7%/94.3%
1613-20
OpenAI logo
GPT Realtime Mini (Oct '25)
917±26Intervalo de 95%: 892 a 943
83079.6%74.6%/83.8%
1713-20
OpenAI logo
GPT-Realtime-2 (Minimal)
916±26Intervalo de 95%: 890 a 941
83084.7%80.3%/88.3%
1813-20
Deepgram logo
Deepgram Voice Agent (Default Cascaded System)
914±26Intervalo de 95%: 888 a 940
81773.7%68.5%/78.2%
1913-20
Amazon logo
Nova Sonic
913±26Intervalo de 95%: 888 a 939
82757.1%51.6%/62.5%
2014-20
SpaceXAI logo
Grok Voice Think Fast 1.0
908±26Intervalo de 95%: 882 a 934
86480.7%75.8%/84.8%
2121-24
Inworld logo
Inworld Realtime (Default Cascaded System)
867±26Intervalo de 95%: 841 a 893
81169.9%64.3%/75.0%
2221-25
Alibaba Cloud logo
Qwen3.5 Omni Plus Realtime
859±26Intervalo de 95%: 833 a 886
82162.0%56.4%/67.2%
2321-25
Alibaba Cloud logo
Qwen Audio 3.0 Realtime Flash
850±40Intervalo de 95%: 810 a 889
16681.7%70.1%/89.4%
2421-25
Alibaba Cloud logo
Qwen3.5 Omni Flash Realtime
841±26Intervalo de 95%: 814 a 867
84729.1%24.0%/34.8%
2522-25
OpenAI logo
GPT-Realtime-2.1 Mini Minimal
840±27Intervalo de 95%: 813 a 867
82176.7%71.1%/81.4%
2626
Alibaba Cloud logo
Qwen Audio 3.0 Realtime Plus
775±44Intervalo de 95%: 731 a 819
17177.8%66.9%/85.8%