Bestenliste für Speech-to-Text-KI-Modelle und -Anbieter
Vergleichen Sie Wortfehlerrate, Geschwindigkeit und Preise von Speech-to-Text-Modellen und -Anbietern.
Weitere Einzelheiten finden Sie auf unserer Methodikseite.
Artificial Analysis Wortfehlerratenindex (ohne Streaming)
Artificial Analysis Wortfehlerratenindex (ohne Streaming)
AA-WER (ohne Streaming) nach Datensatz
AA-WER (ohne Streaming): AA-AgentTalk-Datensatz
Vergleich bereinigter Datensätze
VoxPopuli: bereinigter vs. originaler Teil öffentlich verfügbarer Daten
API-Benchmarks
Artificial Analysis Wortfehlerratenindex (ohne Streaming) vs. Preis
Geschwindigkeitsfaktor
Preis der Transkription
Zusammenfassung wichtiger Kennzahlen & weitere Informationen
Anbieter | Weitere Einzelheiten | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 73.9 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 173.0 | 0.00 | ||
Fun-Realtime-ASR-preview | 1.7% | 21.0 | 0.00 | ||
Nova 2 Pro | 4.9% | 24.0 | 3.10 | ||
Amazon Transcribe | 4.1% | 28.0 | 6.00 | ||
Universal-3 Pro | 3.1% | 101.1 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 118.5 | 2.50 | ||
MAI-Transcribe-2 | 2.0% | 303.6 | 1.67 | ||
MAI-Transcribe-1.5 | 2.4% | 193.6 | 6.00 | ||
transcribe-03-2026 | 4.6% | 124.0 | 0.00 | ||
Nova-3 | 5.2% | 621.8 | 4.30 | ||
Nova-3, Telnyx | 4.8% | 401.7 | 7.40 | ||
Nova-2, Telnyx | 5.1% | 471.1 | 7.40 | ||
Scribe v2 | 2.2% | 76.5 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 73.0 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 65.7 | 10.16 | ||
Chirp 3, Google | 4.3% | 28.7 | 16.00 | ||
Chirp | 31.2% | 14.3 | 16.00 | ||
Gemini 3.5 Transcribe | 2.6% | 85.9 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 5.9 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 9.3 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 20.4 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 79.7 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 67.5 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 11.6 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 76.0 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Voice Transcribe 2.0 | 2.3% | 172.3 | 1.67 | ||
Grok Voice Transcribe 1.0 | 4.0% | 154.6 | 1.67 | ||
Inworld STT 1 | 3.9% | 120.4 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 86.5 | 3.00 | ||
Voxtral Small | 2.8% | 65.6 | 4.00 | ||
Voxtral Mini | 3.8% | 51.3 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 59.2 | 0.42 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 8.8 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 92.5 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 45.1 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 36.0 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 44.7 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 244.2 | 4.00 | ||
Resonant-1 | 3.4% | 324.5 | 3.60 | ||
Rev AI | 5.9% | 12.3 | 3.33 | ||
Smallest AI Pulse | 4.4% | 260.8 | 5.00 | ||
Soniox v5 Async | 3.8% | 35.6 | 1.66 | ||
Speechmatics Melia | 4.9% | 165.9 | 4.00 | ||
Speechmatics Standard | 5.1% | 91.7 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 44.2 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 116.0 | 0.37 | ||
Whisper Large v3 Turbo | 4.6% | 186.7 | 0.67 | ||
Whisper Large v3 Turbo, Telnyx | 5.5% | 39.2 | 15.00 | ||
Wizper Large v3 | 4.7% | 163.4 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 57.0 | 1.49 | ||
Whisper Large v3 | 10.1% | 2.7 | 4.23 | ||
Whisper Large v3 | 4.1% | 75.1 | 1.15 | ||
Whisper Large v2 | 4.1% | 26.8 | 6.00 |
Häufig gestellte Fragen
StepAudio 3 ASR führt mit dem niedrigsten AA-WER (Artificial Analysis Wortfehlerrate) von 1.7% unter 57 bewerteten Modellen.
Die besten Speech-to-Text-Modelle nach Genauigkeit (AA-WER) sind: 1. StepAudio 3 ASR (1.7%), 2. Fun-Realtime-ASR-preview (1.7%), 3. MAI-Transcribe-2 (2.0%), 4. Scribe v2, ElevenLabs (2.2%) und 5. Grok Voice Transcribe 2.0 (2.3%). Ein niedrigerer AA-WER bedeutet eine bessere Transkriptionsgenauigkeit.
Nova-3 ist am schnellsten mit einem Geschwindigkeitsfaktor von 621.8x Echtzeit, gefolgt von Nova-2, Telnyx (471.1x) und Nova-3, Telnyx (401.7x). Höhere Geschwindigkeitsfaktoren bedeuten schnellere Transkription.
StepAudio 2.5 ASR ist am günstigsten mit $0.3667 pro 1.000 Minuten, gefolgt von Modulate STT Batch English VFast ($0.417) und Wizper (L, v3), fal.ai ($0.50).
Voxtral Small, Mistral ist das genaueste Modell mit offenen Gewichten mit einem AA-WER von 2.8%. Es gibt 13 Modelle mit offenen Gewichten von insgesamt 57 bewerteten Modellen.
Die besten Speech-to-Text-Modelle mit offenen Gewichten nach Genauigkeit sind: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) und 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).
Das beste Modell hängt von Ihren Prioritäten ab. Nutzen Sie die Streudiagramme, um Kompromisse zwischen Genauigkeit (AA-WER), Geschwindigkeit und Preis zu visualisieren. Für Anwendungen mit hoher Genauigkeit priorisieren Sie Modelle mit niedrigeren AA-WER-Werten. Für Echtzeitanwendungen konzentrieren Sie sich auf den Geschwindigkeitsfaktor. Für kostensensible Workloads vergleichen Sie die Preisdiagramme.