Bestenliste der Arena für AnbieterstimmenArtificial Analysis
Vergleichen Sie TTS-Modelle mit den eigenen nativen Stimmen jedes Anbieters.
Range | Creator | Model | Elo | 95% CI | Samples | Arena-Stimmen | Veröffentlicht | API-Preise 1 | |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 1 | Sonic 3.6 | 1,282 | -16/16 | 1,911 | Aug 2026 | 49,0 $ /1 Mio. Zeichen | ||
| 2 | 2-3 | Simba 3.2 | 1,241 | -14/14 | 2,437 | Jul 2026 | 10,0 $ /1 Mio. Zeichen | ||
| 3 | 2-3 | Qwen-Audio-3.0-TTS-Plus | 1,240 | -14/14 | 2,448 | Jul 2026 | 27,6 $ /1 Mio. Zeichen | ||
| 4 | 4-6 | Luna TTS | 1,224 | -13/13 | 2,571 | Jun 2026 | 80,0 $ /1 Mio. Zeichen | ||
| 5 | 4-7 | Realtime TTS-2 Flash - Research Preview | 1,222 | -15/15 | 1,727 | Aug 2026 | 10,4 $ /1 Mio. Zeichen | ||
| 6 | 4-10 | Breeze TTS 2 | 1,212 | -17/17 | 1,279 | Aug 2026 | 34,0 $ /1 Mio. Zeichen | ||
| 7 | 4-11 | v3 Conversational | 1,209 | -15/15 | 1,915 | Aug 2026 | 50,0 $ /1 Mio. Zeichen | ||
| 8 | 6-11 | Gemini 3.1 Flash TTS | 1,206 | -12/12 | 3,697 | Apr 2026 | 18,3 $ /1 Mio. Zeichen | ||
| 9 | 6-12 | StepAudio 2.5 TTS | 1,205 | -14/14 | 2,170 | Jun 2026 | 85,0 $ /1 Mio. Zeichen | ||
| 10 | 8-12 | Realtime TTS 1.5 Max | 1,196 | -12/12 | 2,818 | Jan 2026 | 26,0 $ /1 Mio. Zeichen | ||
| 11 | 8-12 | Sonic 3.5 | 1,195 | -12/12 | 3,231 | May 2026 | 49,0 $ /1 Mio. Zeichen | ||
| 12 | 8-14 | Lightning V3.1 Pro (Jul 2026) | 1,192 | -14/14 | 1,963 | Jul 2026 | 19,5 $ /1 Mio. Zeichen | ||
| 13 | 12-15 | Realtime TTS-2 - Research Preview | 1,182 | -12/12 | 2,935 | May 2026 | 20,8 $ /1 Mio. Zeichen | ||
| 14 | 13-16 | Soniox TTS Real-Time v2 | 1,179 | -11/11 | 5,706 | Aug 2026 | 14,2 $ /1 Mio. Zeichen | ||
| 15 | 13-16 | Eleven v3 | 1,178 | -11/11 | 4,555 | Feb 2026 | 100,0 $ /1 Mio. Zeichen | ||
| 16 | 14-16 | Speech 2.8 HD | 1,169 | -11/11 | 4,676 | Feb 2026 | 100,0 $ /1 Mio. Zeichen | ||
| 17 | 16-21 | Falcon 2 | 1,156 | -15/15 | 1,639 | Jul 2026 | 10,0 $ /1 Mio. Zeichen | ||
| 18 | 17-22 | Gradium TTS Beta | 1,152 | -14/14 | 1,641 | Jul 2026 | 47,2 $ /1 Mio. Zeichen | ||
| 19 | 17-21 | Speech 2.8 Turbo | 1,151 | -11/11 | 4,548 | Feb 2026 | 60,0 $ /1 Mio. Zeichen | ||
| 20 | 18-26 | Async Flash v1.5 | 1,142 | -13/13 | 2,335 | May 2026 | 10,1 $ /1 Mio. Zeichen | ||
| 21 | 18-26 | Fish Audio S2.1 Pro | 1,141 | -13/13 | 2,278 | Jun 2026 | 15,0 $ /1 Mio. Zeichen | ||
| 22 | 20-26 | Step TTS 2 (Mar 2026) | 1,138 | -12/12 | 2,409 | Feb 2026 | 40,0 $ /1 Mio. Zeichen | ||
| 23 | 20-30 | Speech 2.6 HD | 1,134 | -11/11 | 4,163 | Oct 2025 | 100,0 $ /1 Mio. Zeichen | ||
| 24 | 20-31 | Lightning V3.1 Pro TTS (Jun 2026) | 1,132 | -13/13 | 2,258 | Jun 2026 | 19,5 $ /1 Mio. Zeichen | ||
| 25 | 20-31 | Azure HD 2.5 | 1,131 | -12/12 | 2,670 | Mar 2026 | 22,0 $ /1 Mio. Zeichen | ||
| 26 | 20-31 | Realtime TTS 1.5 Mini | 1,131 | -12/12 | 3,162 | Jan 2026 | 10,4 $ /1 Mio. Zeichen | ||
| 27 | 23-31 | Fish Audio S2 Pro | 1,126 | -12/12 | 2,313 | Mar 2026 | 15,0 $ /1 Mio. Zeichen | ||
| 28 | 22-31 | Async Pro v1.0 | 1,126 | -13/13 | 2,166 | May 2026 | 20,2 $ /1 Mio. Zeichen | ||
| 29 | 22-31 | SpaceXAI TTS | 1,126 | -15/15 | 1,151 | Mar 2026 | 15,0 $ /1 Mio. Zeichen | ||
| 30 | 23-31 | Speech 2.6 Turbo | 1,124 | -11/11 | 4,534 | Oct 2025 | 60,0 $ /1 Mio. Zeichen | ||
| 31 | 23-31 | Simba 3.0 | 1,123 | -12/12 | 2,716 | Feb 2026 | 12,5 $ /1 Mio. Zeichen | ||
| 32 | 32-35 | Speech-02-HD | 1,109 | -11/11 | 4,552 | Mar 2025 | 100,0 $ /1 Mio. Zeichen | ||
| 33 | 32-36 | TTS-1 HD | 1,108 | -11/11 | 3,724 | Nov 2023 | 30,0 $ /1 Mio. Zeichen | ||
| 34 | 32-38 | Turbo v2.5 | 1,100 | -10/10 | 7,422 | Jul 2024 | 50,0 $ /1 Mio. Zeichen | ||
| 35 | 33-38 | Multilingual v2 | 1,099 | -10/10 | 7,879 | Aug 2023 | 100,0 $ /1 Mio. Zeichen | ||
| 36 | 32-40 | Step Audio EditX (Mar 2026) | 1,098 | -13/13 | 2,077 | Feb 2026 | k. A. | ||
| 37 | 34-44 | Chatterbox HD | 1,093 | -12/12 | 2,451 | — | May 2025 | 40,0 $ /1 Mio. Zeichen | |
| 38 | 34-43 | TTS-1 | 1,091 | -10/10 | 6,622 | Nov 2023 | 15,0 $ /1 Mio. Zeichen | ||
| 39 | 36-47 | Gradium TTS | 1,085 | -13/13 | 2,045 | Jun 2026 | 47,2 $ /1 Mio. Zeichen | ||
| 40 | 37-46 | Gemini 2.5 Flash Lite TTS | 1,085 | -11/11 | 3,264 | Dec 2025 | 9,2 $ /1 Mio. Zeichen | ||
| 41 | 37-47 | Speech-02-Turbo | 1,083 | -11/11 | 4,020 | Mar 2025 | 60,0 $ /1 Mio. Zeichen | ||
| 42 | 37-47 | Studio | 1,082 | -11/11 | 4,800 | Feb 2023 | 160,0 $ /1 Mio. Zeichen | ||
| 43 | 37-47 | Voxtral TTS | 1,082 | -12/12 | 2,252 | Mar 2026 | 16,0 $ /1 Mio. Zeichen | ||
| 44 | 37-49 | Speech 2.6 | 1,081 | -13/13 | 1,972 | Jul 2026 | k. A. | ||
| 45 | 39-47 | Flash v2.5 | 1,079 | -10/10 | 6,066 | Dec 2024 | 50,0 $ /1 Mio. Zeichen | ||
| 46 | 39-50 | OpenAudio S1 | 1,077 | -11/11 | 4,712 | Jun 2025 | 15,0 $ /1 Mio. Zeichen | ||
| 47 | 40-54 | Journey | 1,073 | -12/12 | 2,346 | Dec 2023 | 160,0 $ /1 Mio. Zeichen | ||
| 48 | 42-59 | Maya 2 Flash | 1,069 | -14/14 | 1,912 | Jul 2026 | k. A. | ||
| 49 | 44-59 | GPT-Realtime-2 | 1,069 | -13/13 | 2,075 | May 2026 | 191,6 $ /1 Mio. Zeichen | ||
| 50 | 46-59 | Sonic 3 | 1,067 | -11/11 | 3,743 | Oct 2025 | 49,0 $ /1 Mio. Zeichen | ||
| 51 | 47-60 | T2A-01-HD | 1,066 | -11/11 | 5,201 | Jan 2025 | 50,0 $ /1 Mio. Zeichen | ||
| 52 | 47-61 | Magpie-Multilingual 357M (Feb 2026) | 1,064 | -12/12 | 2,113 | Feb 2026 | k. A. | ||
| 53 | 47-61 | Polly Generative | 1,063 | -11/11 | 4,022 | May 2024 | 30,0 $ /1 Mio. Zeichen | ||
| 54 | 47-61 | SIMBA 1.6 | 1,063 | -12/12 | 2,418 | Oct 2024 | 10,0 $ /1 Mio. Zeichen | ||
| 55 | 47-62 | Maya 2 Global | 1,061 | -14/14 | 1,837 | Jul 2026 | k. A. | ||
| 56 | 48-62 | MiMo-V2.5-TTS | 1,059 | -12/12 | 2,106 | - | k. A. | ||
| 57 | 50-62 | Kokoro 82M v1.0 | 1,058 | -11/11 | 5,673 | Jan 2025 | 0,7 $ /1 Mio. Zeichen | ||
| 58 | 48-63 | Coda | 1,057 | -12/12 | 2,343 | May 2026 | 50,0 $ /1 Mio. Zeichen | ||
| 59 | 50-63 | Gemini 2.5 Flash TTS (Dec 2025) | 1,056 | -12/12 | 3,057 | Dec 2025 | 9,2 $ /1 Mio. Zeichen | ||
| 60 | 50-64 | Octave 2 | 1,055 | -12/12 | 3,258 | Oct 2025 | 87,5 $ /1 Mio. Zeichen | ||
| 61 | 52-64 | Chirp 3: HD | 1,054 | -11/11 | 3,626 | Mar 2025 | 30,0 $ /1 Mio. Zeichen | ||
| 62 | 50-72 | OpenAudio S1 Mini | 1,049 | -19/19 | 1,777 | Jun 2025 | 15,0 $ /1 Mio. Zeichen | ||
| 63 | 59-68 | Async Flash v1.0 | 1,046 | -11/11 | 4,223 | Jul 2025 | 10,1 $ /1 Mio. Zeichen | ||
| 64 | 57-72 | Bland Speech v3 | 1,044 | -14/14 | 1,482 | Aug 2026 | 40,0 $ /1 Mio. Zeichen | ||
| 65 | 62-72 | Maya1 | 1,042 | -12/12 | 3,508 | Jun 2025 | k. A. | ||
| 66 | 62-74 | Sonic English (Oct 2024) | 1,041 | -12/12 | 3,613 | Oct 2024 | 49,0 $ /1 Mio. Zeichen | ||
| 67 | 62-74 | Polly Long-Form | 1,041 | -13/13 | 2,051 | Nov 2023 | 100,0 $ /1 Mio. Zeichen | ||
| 68 | 62-74 | Higgs Audio V3 TTS | 1,039 | -13/13 | 2,101 | Jun 2026 | 15,0 $ /1 Mio. Zeichen | ||
| 69 | 64-74 | SIMBA 1.0 | 1,035 | -11/11 | 5,179 | Jun 2024 | 10,0 $ /1 Mio. Zeichen | ||
| 70 | 64-74 | Gemini 2.5 Pro (Dec 2025) | 1,034 | -12/12 | 2,633 | Dec 2025 | 18,3 $ /1 Mio. Zeichen | ||
| 71 | 65-74 | T2A-01-Turbo | 1,032 | -11/11 | 5,311 | Jan 2025 | 30,0 $ /1 Mio. Zeichen | ||
| 72 | 65-75 | MAI-Voice-1 | 1,032 | -12/12 | 2,346 | Apr 2026 | k. A. | ||
| 73 | 68-76 | Octave TTS | 1,030 | -11/11 | 5,043 | Feb 2025 | 87,5 $ /1 Mio. Zeichen | ||
| 74 | 63-77 | Azure Neural | 1,029 | -19/19 | 1,226 | Sept 2018 | 15,0 $ /1 Mio. Zeichen | ||
| 75 | 71-77 | MiMo-V2-TTS | 1,021 | -13/13 | 1,913 | Mar 2026 | k. A. | ||
| 76 | 73-77 | Chatterbox | 1,019 | -11/11 | 4,942 | May 2025 | 25,0 $ /1 Mio. Zeichen | ||
| 77 | 73-77 | Lightning v3.1 | 1,018 | -12/12 | 2,370 | Mar 2026 | 25,0 $ /1 Mio. Zeichen | ||
| 78 | 77-81 | Raon SpeechLM | 1,006 | -13/13 | 2,132 | - | k. A. | ||
| 79 | 78-81 | Arcana v3 | 1,005 | -12/12 | 2,407 | Feb 2026 | 50,0 $ /1 Mio. Zeichen | ||
| 80 | 78-81 | Magpie-Multilingual 357M | 1,003 | -11/11 | 3,928 | Jan 2026 | k. A. | ||
| 81 | 81 | Zonos-v0.1 | 1,000 | 0/0 | 5,182 | Feb 2025 | 20,0 $ /1 Mio. Zeichen | ||
| 82 | 82-84 | LMNT | 978 | -12/12 | 4,209 | Dec 2023 | 49,0 $ /1 Mio. Zeichen | ||
| 83 | 82-84 | Murf Speech Gen 2 | 978 | -11/11 | 5,433 | Jul 2024 | 100,0 $ /1 Mio. Zeichen | ||
| 84 | 82-85 | VibeVoice 7B | 968 | -13/13 | 2,255 | Aug 2025 | k. A. | ||
| 85 | 82-86 | VibeVoice 1.5B | 966 | -13/13 | 2,281 | Aug 2025 | k. A. | ||
| 86 | 85-87 | OpenVoice v2 | 953 | -13/13 | 3,211 | — | Apr 2024 | 8,3 $ /1 Mio. Zeichen | |
| 87 | 86-89 | Qwen3 TTS Flash | 941 | -14/14 | 2,263 | Sept 2025 | 10,0 $ /1 Mio. Zeichen | ||
| 88 | 86-89 | Magpie Multilingual | 939 | -14/14 | 2,133 | Apr 2025 | k. A. | ||
| 89 | 87-91 | Neuphonic TTS | 933 | -13/13 | 2,495 | Oct 2024 | 20,8 $ /1 Mio. Zeichen | ||
| 90 | 89-92 | Qwen3 TTS | 924 | -13/13 | 3,012 | Jan 2026 | 20,0 $ /1 Mio. Zeichen | ||
| 91 | 89-93 | Kugel 3 | 923 | -13/13 | 4,225 | - | k. A. | ||
| 92 | 90-93 | XTTS v2 | 919 | -14/14 | 2,754 | — | Nov 2023 | 40,4 $ /1 Mio. Zeichen | |
| 93 | 92-93 | WaveNet | 911 | -12/12 | 6,783 | Sept 2016 | 4,0 $ /1 Mio. Zeichen | ||
| 94 | 93-97 | Mist V2 | 897 | -14/14 | 3,009 | Mar 2025 | 31,1 $ /1 Mio. Zeichen | ||
| 95 | 94-98 | StyleTTS 2 | 891 | -15/15 | 2,629 | — | Jun 2023 | 2,8 $ /1 Mio. Zeichen | |
| 96 | 94-98 | Neural2 | 889 | -12/12 | 6,993 | Jun 2022 | 16,0 $ /1 Mio. Zeichen | ||
| 97 | 94-98 | Polly Neural | 888 | -14/14 | 2,932 | Jul 2019 | 16,0 $ /1 Mio. Zeichen | ||
| 98 | 95-98 | Standard | 881 | -12/12 | 7,044 | Aug 2018 | 4,0 $ /1 Mio. Zeichen | ||
| 99 | 98-99 | Noiz TTS | 867 | -15/15 | 1,960 | Nov 2025 | k. A. | ||
| 100 | 100 | MetaVoice v1 | 842 | -17/17 | 1,465 | — | Feb 2024 | k. A. | |
| 101 | 101 | Polly Standard | 817 | -15/15 | 3,604 | Nov 2016 | 4,0 $ /1 Mio. Zeichen |
1 API-Preise spiegeln die Kosten wider, 1M Zeichen über die API des Modellerstellers mit den Standardeinstellungen des Modells zu erzeugen
Häufig gestellte Fragen
Die besten Text-to-Speech-Modelle nach Elo-Bewertung sind: 1. Sonic 3.6 (Elo 1282), 2. Simba 3.2 (Elo 1241), 3. Qwen-Audio-3.0-TTS-Plus (Elo 1240), 4. Luna TTS (Elo 1224) und 5. Realtime TTS-2 Flash - Research Preview (Elo 1222). Die Rankings basieren auf blinden Nutzerstimmen in der Speech Arena.
Kokoro 82M v1.0 ist mit $0.65 pro 1M Zeichen das günstigste und hat einen Elo-Wert von 1058. Weitere günstige Optionen sind StyleTTS 2 mit $2.82 pro 1M Zeichen.
Die Top 5 Text-to-Speech-Modelle mit offenen Gewichten sind: 1. Breeze TTS 2 (Elo 1212), 2. Fish Audio S2 Pro (Elo 1126), 3. Step Audio EditX (Mar 2026) (Elo 1098), 4. Voxtral TTS (Elo 1082) und 5. Magpie-Multilingual 357M (Feb 2026) (Elo 1064).