Speech Agent Arena LeaderboardArtificial Analysis

Compare Speech to Speech models by preference across blind, live voice conversations on topics like booking a dental appointment and ordering takeout. For more details, see overview and methodology, or visit Compare Models & Providers to compare Speech to Speech models across other benchmarks.

Range
Model
Elo
Samples
Task Success Rate
TSR 95% CI
11-2
Google logo
Gemini 3.1 Flash Live Minimal
1096±2795% interval 1068 to 1123
84174.6%69.4%/79.2%
21-4
Google logo
Gemini 3.8 Live
1083±3095% interval 1053 to 1113
48293.2%89.0%/95.8%
32-5
Google logo
Gemini 3.1 Flash Live High
1063±2795% interval 1036 to 1090
81371.8%66.4%/76.7%
43-6
OpenAI logo
GPT-Live-1 (Sol, low)
1053±2795% interval 1026 to 1081
65290.9%87.2%/93.7%
53-6
OpenAI logo
GPT-Live-1 (Astra, medium)
1048±2895% interval 1020 to 1076
61087.4%82.9%/90.8%
63-9
Cartesia logo
Cartesia Line (Default Cascaded System)
1027±3795% interval 990 to 1064
19077.5%68.9%/84.3%
76-10
SpaceXAI logo
Grok Voice Think Fast 2.0 High
1011±2895% interval 983 to 1038
55294.6%91.4%/96.7%
88
OpenAI logo
GPT-Realtime-1.5
1000AnchorFixed at 1000 as the reference point for this board's Elo scale.
81185.1%80.8%/88.6%
97-12
ElevenLabs logo
ElevenLabs Agents (Default Cascaded System)
993±2695% interval 967 to 1020
77390.5%86.7%/93.4%
107-12
Google logo
Gemini 3.8 Live Extended Thinking (High)
990±2795% interval 963 to 1017
64389.1%84.7%/92.4%
118-12
OpenAI logo
GPT Realtime (Aug '25)
974±2695% interval 948 to 1000
79789.4%85.2%/92.6%
129-12
Amazon Bedrock logo
Nova 2.0 Sonic (Mar 2026)
974±2695% interval 948 to 1000
79557.1%51.1%/62.9%
1313-19
OpenAI logo
GPT-Realtime-2.1 Minimal
937±2695% interval 911 to 963
79889.4%85.2%/92.5%
1413-20
OpenAI logo
GPT-Realtime-2 (High)
932±2695% interval 906 to 958
76489.8%85.7%/92.9%
1513-20
OpenAI logo
GPT-Realtime-2.1 High
928±2695% interval 902 to 954
74991.5%87.7%/94.3%
1613-20
OpenAI logo
GPT Realtime Mini (Oct '25)
917±2695% interval 892 to 943
83079.6%74.6%/83.8%
1713-20
OpenAI logo
GPT-Realtime-2 (Minimal)
916±2695% interval 890 to 941
83084.7%80.3%/88.3%
1813-20
Deepgram logo
Deepgram Voice Agent (Default Cascaded System)
914±2695% interval 888 to 940
81773.7%68.5%/78.2%
1913-20
Amazon logo
Nova Sonic
913±2695% interval 888 to 939
82757.1%51.6%/62.5%
2014-20
SpaceXAI logo
Grok Voice Think Fast 1.0
908±2695% interval 882 to 934
86480.7%75.8%/84.8%
2121-24
Inworld logo
Inworld Realtime (Default Cascaded System)
867±2695% interval 841 to 893
81169.9%64.3%/75.0%
2221-25
Alibaba Cloud logo
Qwen3.5 Omni Plus Realtime
859±2695% interval 833 to 886
82162.0%56.4%/67.2%
2321-25
Alibaba Cloud logo
Qwen Audio 3.0 Realtime Flash
850±4095% interval 810 to 889
16681.7%70.1%/89.4%
2421-25
Alibaba Cloud logo
Qwen3.5 Omni Flash Realtime
841±2695% interval 814 to 867
84729.1%24.0%/34.8%
2522-25
OpenAI logo
GPT-Realtime-2.1 Mini Minimal
840±2795% interval 813 to 867
82176.7%71.1%/81.4%
2626
Alibaba Cloud logo
Qwen Audio 3.0 Realtime Plus
775±4495% interval 731 to 819
17177.8%66.9%/85.8%