Bestenliste für Speech-to-Text-KI-Modelle und -Anbieter

Vergleichen Sie Wortfehlerrate, Geschwindigkeit und Preise von Speech-to-Text-Modellen und -Anbietern.

Weitere Einzelheiten finden Sie auf unserer Methodikseite.

Highlights

AA-WER v2 · % of words transcribed incorrectly · Lower is better
Input audio seconds transcribed per second · Higher is better
USD per 1000 minutes of audio · Lower is better

Artificial Analysis Wortfehlerratenindex (ohne Streaming)

Artificial Analysis Wortfehlerratenindex (ohne Streaming)

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%)
Hinweis: Wenn ein Modell bei Earnings22 aufgrund von Zeitlimits Audio in voller Länge nicht zuverlässig verarbeiten kann, teilen wir es in Segmente von ca. 9 Minuten auf (relevant für: GPT-4o Mini Transcribe, OpenAI, Nova 2 Pro, Amazon und GPT-4o Transcribe, OpenAI). Bei Modellen mit noch kürzeren Zeitlimits teilen wir es in Segmente von ca. 30 Sekunden auf (relevant für: Inworld STT 1, Canary Qwen 2.5B, NVIDIA und Qwen3 ASR Flash, Alibaba).

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

AA-WER (ohne Streaming) nach Datensatz

AA-WER (ohne Streaming): AA-AgentTalk-Datensatz

% of words transcribed incorrectly on the AA-AgentTalk dataset · Lower is better

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Vergleich bereinigter Datensätze

VoxPopuli: bereinigter vs. originaler Teil öffentlich verfügbarer Daten

% WER (word error rate) · Lower is better
Sortieren nach
Hinweis: Die bereinigten Versionen entfernen Transkriptionsfehler aus dem Referenztext und liefern so eine genauere Ground Truth für die Modellbewertung.

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

API-Benchmarks

Artificial Analysis Wortfehlerratenindex (ohne Streaming) vs. Preis

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%) · USD per 1000 minutes of audio
Most attractive quadrant

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Geschwindigkeitsfaktor

Input audio seconds transcribed per second · Higher is better

Audio file seconds transcribed per second of processing time. Higher factor indicates faster transcription speed. Reported Speed Factor values are medians across benchmark trials from the last 7 days; over-time chart points are daily medians. Artificial Analysis measurements are based on an audio duration of 10 minutes. Speed Factor may vary for other durations, particularly very short durations under 1 minute.

Preis der Transkription

USD per 1000 minutes of audio

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Zusammenfassung wichtiger Kennzahlen & weitere Informationen

Anbieter
Weitere Einzelheiten
Qwen3.5 Omni Flash
Logo von Qwen3.5 Omni FlashAlibaba Cloud
13.5%
77.9
0.00
Qwen3.5 Omni Plus
Logo von Qwen3.5 Omni PlusAlibaba Cloud
3.5%
95.0
0.00
Nova 2 Pro
Logo von Nova 2 ProAmazon Bedrock
4.9%
22.9
3.10
Amazon Transcribe
Logo von Amazon TranscribeAmazon Bedrock
4.1%
18.8
6.00
Universal-3 Pro
Logo von Universal-3 ProAssemblyAI
3.1%
98.7
3.50
Universal, AssemblyAI
Logo von Universal, AssemblyAIAssemblyAI
3.8%
123.3
2.50
MAI-Transcribe-1.5
Logo von MAI-Transcribe-1.5Microsoft Azure
2.4%
192.5
6.00
MAI-Transcribe-1
Logo von MAI-Transcribe-1Microsoft Azure
2.6%
67.8
6.00
transcribe-03-2026
Logo von transcribe-03-2026Cohere
4.6%
119.1
0.00
Nova-3
Logo von Nova-3Deepgram
5.2%
501.4
4.30
Scribe v2
Logo von Scribe v2ElevenLabs
2.2%
53.9
3.67
Solaria-1, Gladia
Logo von Solaria-1, GladiaGladia
4.1%
81.2
10.17
Solaria-3, Gladia
Logo von Solaria-3, GladiaGladia
3.2%
62.7
10.16
Gemini 3.5 Transcribe
Logo von Gemini 3.5 TranscribeGoogle
2.6%
82.5
5.00
Gemini 3.1 Pro Preview (High)
Logo von Gemini 3.1 Pro Preview (High)Google
2.8%
7.4
18.15
Gemini 3.1 Pro Preview (Low)
Logo von Gemini 3.1 Pro Preview (Low)Google
3.6%
6.5
7.72
Gemini 3 Flash (High)
Logo von Gemini 3 Flash (High)Google
2.9%
18.3
13.70
Gemini 2.5 Flash Lite
Logo von Gemini 2.5 Flash LiteGoogle
5.2%
81.2
6.56
Gemini 2.5 Flash
Logo von Gemini 2.5 FlashGoogle
5.1%
77.3
6.66
Gemini 2.5 Pro
Logo von Gemini 2.5 ProGoogle
2.9%
12.3
11.39
Gemini 3.1 Flash-Lite Preview (Minimal)
Logo von Gemini 3.1 Flash-Lite Preview (Minimal)Google
3.4%
79.9
5.83
Gradium Speech-to-Text
Logo von Gradium Speech-to-TextGradium
6.8%
2.3
13.00
Grok Speech to Text, SpaceXAI
Logo von Grok Speech to Text, SpaceXAISpaceXAI
4.0%
225.0
1.67
Inworld STT 1
Logo von Inworld STT 1Inworld
3.9%
206.9
2.50
Voxtral Mini Transcribe 2
Logo von Voxtral Mini Transcribe 2Mistral
3.6%
82.6
3.00
Voxtral Small
Logo von Voxtral SmallMistral
2.8%
65.7
4.00
Voxtral Mini
Logo von Voxtral MiniDeepInfra
3.8%
79.1
1.00
Modulate STT Batch English VFast
Logo von Modulate STT Batch English VFastModulate
4.2%
61.9
0.42
Parakeet TDT 0.6B V3, Togetherai
Logo von Parakeet TDT 0.6B V3, TogetheraiTogether AI
4.5%
273.1
1.50
Canary Qwen 2.5B, NVIDIA
Logo von Canary Qwen 2.5B, NVIDIAReplicate
4.3%
7.9
0.74
Parakeet TDT 0.6B V2, NVIDIA
Logo von Parakeet TDT 0.6B V2, NVIDIANVIDIA
6.4%
99.9
0.00
Parakeet RNNT 1.1B
Logo von Parakeet RNNT 1.1BReplicate
5.4%
6.3
1.91
GPT Transcribe, OpenAI
Logo von GPT Transcribe, OpenAIOpenAI
3.3%
40.8
4.50
GPT-4o Transcribe
Logo von GPT-4o TranscribeOpenAI
4.0%
37.1
6.00
GPT-4o Mini Transcribe
Logo von GPT-4o Mini TranscribeOpenAI
4.5%
41.4
3.00
Smallest AI Pulse Pro
Logo von Smallest AI Pulse ProSmallest.ai
2.4%
272.9
4.00
Resonant-1
Logo von Resonant-1Reson8
3.4%
331.6
3.60
Rev AI
Logo von Rev AIRev AI
5.9%
12.9
3.33
Smallest AI Pulse
Logo von Smallest AI PulseSmallest.ai
4.4%
274.9
5.00
Soniox v5 Async
Logo von Soniox v5 AsyncSoniox
3.8%
35.1
1.66
Soniox V4
Logo von Soniox V4Soniox
3.9%
39.7
1.66
Speechmatics Melia
Logo von Speechmatics MeliaSpeechmatics
4.9%
204.1
4.00
Speechmatics Standard
Logo von Speechmatics StandardSpeechmatics
5.1%
107.1
7.50
Speechmatics Enhanced
Logo von Speechmatics EnhancedSpeechmatics
4.0%
70.6
12.50
StepAudio 2.5 ASR, StepFun
Logo von StepAudio 2.5 ASR, StepFunStepFun
4.7%
81.5
0.37
Whisper Large v3 Turbo
Logo von Whisper Large v3 TurboGroq
4.6%
130.1
0.67
Wizper Large v3
Logo von Wizper Large v3fal.ai
4.7%
287.6
0.50
Incredibly Fast Whisper
Logo von Incredibly Fast WhisperReplicate
5.7%
55.1
1.49
Whisper Large v3
Logo von Whisper Large v3Replicate
10.1%
2.6
4.23
Whisper Large v3
Logo von Whisper Large v3fal.ai
4.1%
71.8
1.15
Whisper Large v3
Logo von Whisper Large v3Together AI
4.5%
288.1
1.50
Whisper Large v2
Logo von Whisper Large v2OpenAI
4.1%
28.8
6.00

Häufig gestellte Fragen

Fun-Realtime-ASR-preview führt mit dem niedrigsten AA-WER (Artificial Analysis Wortfehlerrate) von 1.7% unter 57 bewerteten Modellen.

Die besten Speech-to-Text-Modelle nach Genauigkeit (AA-WER) sind: 1. Fun-Realtime-ASR-preview (1.7%), 2. Scribe v2, ElevenLabs (2.2%), 3. MAI-Transcribe-1.5 (2.4%), 4. Smallest AI Pulse Pro (2.4%) und 5. Gemini 3.5 Transcribe (2.6%). Ein niedrigerer AA-WER bedeutet eine bessere Transkriptionsgenauigkeit.

Nova-3 ist am schnellsten mit einem Geschwindigkeitsfaktor von 501.4x Echtzeit, gefolgt von Resonant-1 (331.6x) und Whisper Large v3, together.ai (288.1x). Höhere Geschwindigkeitsfaktoren bedeuten schnellere Transkription.

StepAudio 2.5 ASR ist am günstigsten mit $0.3667 pro 1.000 Minuten, gefolgt von Modulate STT Batch English VFast ($0.417) und Wizper (L, v3), fal.ai ($0.50).

Voxtral Small, Mistral ist das genaueste Modell mit offenen Gewichten mit einem AA-WER von 2.8%. Es gibt 12 Modelle mit offenen Gewichten von insgesamt 57 bewerteten Modellen.

Die besten Speech-to-Text-Modelle mit offenen Gewichten nach Genauigkeit sind: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) und 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).

Das beste Modell hängt von Ihren Prioritäten ab. Nutzen Sie die Streudiagramme, um Kompromisse zwischen Genauigkeit (AA-WER), Geschwindigkeit und Preis zu visualisieren. Für Anwendungen mit hoher Genauigkeit priorisieren Sie Modelle mit niedrigeren AA-WER-Werten. Für Echtzeitanwendungen konzentrieren Sie sich auf den Geschwindigkeitsfaktor. Für kostensensible Workloads vergleichen Sie die Preisdiagramme.