Speech Agent Arena BestenlisteArtificial Analysis

Vergleiche Speech-to-Speech-Modelle nach Blindpräferenz in Live-Sprachgesprächen zu Themen wie dem Buchen eines Zahnarzttermins und dem Bestellen von Essen. Weitere Details siehe Überblick und Methodik, oder besuche Modelle und Anbieter vergleichen, um Speech-to-Speech-Modelle in weiteren Benchmarks zu vergleichen.

Range
Creator
Model
Elo
Elo 95% CI
Samples
Task Success Rate
TSR 95% CI
11
Google logoGoogle
Gemini 3.1 Flash Live Preview - Minimal
1046-30/3076874.6%69.4%/79.2%
22-3
Google logoGoogle
Gemini 3.1 Flash Live Preview - High
1014-29/2976371.8%66.4%/76.7%
33
OpenAI logoOpenAI
GPT-Realtime-1.5
10000/076285.1%80.8%/88.6%
44-6
OpenAI logoOpenAI
GPT Realtime (Aug '25)
944-27/2774789.4%85.2%/92.6%
54-8
ElevenLabs logoElevenLabs
ElevenLabs Agents (Default Cascaded System)
937-28/2867690.5%86.7%/93.4%
64-11
Amazon Bedrock logoAmazon Bedrock
Nova 2.0 Sonic (Mar 2026)
917-27/2771857.1%51.1%/62.9%
75-11
OpenAI logoOpenAI
GPT-Realtime-2 (High)
914-27/2770889.8%85.7%/92.9%
85-11
OpenAI logoOpenAI
GPT Realtime Mini (Oct '25)
912-27/2778479.6%74.6%/83.8%
96-13
SpaceXAI logoSpaceXAI
Grok Voice Think Fast 2.0 High
908-28/2864894.7%91.5%/96.8%
106-13
OpenAI logoOpenAI
GPT-Realtime-2.1 Minimal
896-27/2770489.4%85.2%/92.5%
116-13
OpenAI logoOpenAI
GPT-Realtime-2.1 High
892-27/2765691.5%87.7%/94.3%
129-13
Deepgram logoDeepgram
Deepgram Voice Agent (Default Cascaded System)
882-27/2773073.7%68.5%/78.2%
1310-13
OpenAI logoOpenAI
GPT-Realtime-2 (Minimal)
881-27/2778984.7%80.3%/88.3%
1414-15
Amazon logoAmazon
Nova Sonic
852-27/2776357.1%51.6%/62.5%
1514-15
SpaceXAI logoSpaceXAI
Grok Voice Think Fast 1.0
839-27/2781680.7%75.8%/84.8%
1616-19
Alibaba Cloud logoAlibaba Cloud
Qwen3.5 Omni Plus Realtime
799-27/2777962.0%56.4%/67.2%
1716-19
Alibaba Cloud logoAlibaba Cloud
Qwen3.5 Omni Flash Realtime
797-27/2778029.1%24.0%/34.8%
1816-19
OpenAI logoOpenAI
GPT-Realtime-2.1 Mini Minimal
792-28/2874276.7%71.1%/81.4%
1916-19
Inworld logoInworld
Inworld Realtime (Default Cascaded System)
785-29/2968369.9%64.3%/75.0%
2019-20
Alibaba Cloud logoAlibaba Cloud
Qwen Audio 3.0 Realtime Flash
752-39/3916881.7%70.1%/89.4%
2121
Alibaba Cloud logoAlibaba Cloud
Qwen Audio 3.0 Realtime Plus
699-40/4018677.8%66.9%/85.8%

A Default Cascaded System is a provider’s standard voice-agent pipeline: its orchestration harness connects a speech-to-text model, an LLM, and a text-to-speech model. These entries use the provider’s default stack, rather than a custom pipeline optimized by Artificial Analysis.

Tool registration indicates whether tool definitions are pre-registered or supplied during session setup. As of July 2026:

ModelHarnessSTTLLMTTSTool registration
Deepgram Voice AgentDeepgram Voice Agent APINova-3GPT-4o MiniAura-2Session-level
ElevenLabs AgentsElevenLabs AgentsScribe v2 RealtimeGPT-4o MiniEleven v3Pre-registered
Inworld RealtimeInworld Realtime APIInworld STT 1Gemini 2.5 FlashInworld TTS 1.5 MiniSession-level