Tabla de clasificación de modelos y proveedores de voz a texto

Compara la tasa de error de palabras, la velocidad y los precios entre modelos y proveedores de voz a texto.

Para más detalles, consulta nuestra página de metodología.

Destacados

AA-WER v2 · % of words transcribed incorrectly · Lower is better
Input audio seconds transcribed per second · Higher is better
USD per 1000 minutes of audio · Lower is better

Índice de tasa de error de palabras de Artificial Analysis (sin streaming)

Índice de tasa de error de palabras de Artificial Analysis (sin streaming)

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%)
Nota: Para Earnings22, si un modelo no puede manejar de forma fiable audio de duración completa por límites de tiempo, segmentamos en ~9 minutos (relevante para: GPT-4o Mini Transcribe, OpenAI, Nova 2 Pro, Amazon y GPT-4o Transcribe, OpenAI). Para modelos con límites de tiempo aún más cortos, segmentamos en ~30 segundos (relevante para: Inworld STT 1, Canary Qwen 2.5B, NVIDIA y Qwen3 ASR Flash, Alibaba).

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

AA-WER (sin streaming) por conjunto de datos

AA-WER (sin streaming): conjunto de datos AA-AgentTalk

% of words transcribed incorrectly on the AA-AgentTalk dataset · Lower is better

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Comparación de conjuntos de datos limpios

VoxPopuli: subconjunto limpio vs. original de datos disponibles públicamente

% WER (word error rate) · Lower is better
Ordenar por
Nota: Las versiones limpias eliminan errores de transcripción del texto de referencia, lo que proporciona una verdad de base más precisa para evaluar los modelos.

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Benchmarks de API

Índice de tasa de error de palabras de Artificial Analysis (sin streaming) vs. precio

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%) · USD per 1000 minutes of audio
Most attractive quadrant

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Factor de velocidad

Input audio seconds transcribed per second · Higher is better

Audio file seconds transcribed per second of processing time. Higher factor indicates faster transcription speed. Reported Speed Factor values are medians across benchmark trials from the last 7 days; over-time chart points are daily medians. Artificial Analysis measurements are based on an audio duration of 10 minutes. Speed Factor may vary for other durations, particularly very short durations under 1 minute.

Precio de transcripción

USD per 1000 minutes of audio

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Resumen de métricas clave e información adicional

Proveedor
Más detalles
Qwen3.5 Omni Flash
Logo de Qwen3.5 Omni FlashAlibaba Cloud
13.5%
77.9
0.00
Qwen3.5 Omni Plus
Logo de Qwen3.5 Omni PlusAlibaba Cloud
3.5%
95.0
0.00
Nova 2 Pro
Logo de Nova 2 ProAmazon Bedrock
4.9%
22.9
3.10
Amazon Transcribe
Logo de Amazon TranscribeAmazon Bedrock
4.1%
18.8
6.00
Universal-3 Pro
Logo de Universal-3 ProAssemblyAI
3.1%
98.7
3.50
Universal, AssemblyAI
Logo de Universal, AssemblyAIAssemblyAI
3.8%
123.3
2.50
MAI-Transcribe-1.5
Logo de MAI-Transcribe-1.5Microsoft Azure
2.4%
192.5
6.00
MAI-Transcribe-1
Logo de MAI-Transcribe-1Microsoft Azure
2.6%
67.8
6.00
transcribe-03-2026
Logo de transcribe-03-2026Cohere
4.6%
119.1
0.00
Nova-3
Logo de Nova-3Deepgram
5.2%
501.4
4.30
Scribe v2
Logo de Scribe v2ElevenLabs
2.2%
53.9
3.67
Solaria-1, Gladia
Logo de Solaria-1, GladiaGladia
4.1%
81.2
10.17
Solaria-3, Gladia
Logo de Solaria-3, GladiaGladia
3.2%
62.7
10.16
Gemini 3.5 Transcribe
Logo de Gemini 3.5 TranscribeGoogle
2.6%
82.5
5.00
Gemini 3.1 Pro Preview (High)
Logo de Gemini 3.1 Pro Preview (High)Google
2.8%
7.4
18.15
Gemini 3.1 Pro Preview (Low)
Logo de Gemini 3.1 Pro Preview (Low)Google
3.6%
6.5
7.72
Gemini 3 Flash (High)
Logo de Gemini 3 Flash (High)Google
2.9%
18.3
13.70
Gemini 2.5 Flash Lite
Logo de Gemini 2.5 Flash LiteGoogle
5.2%
81.2
6.56
Gemini 2.5 Flash
Logo de Gemini 2.5 FlashGoogle
5.1%
77.3
6.66
Gemini 2.5 Pro
Logo de Gemini 2.5 ProGoogle
2.9%
12.3
11.39
Gemini 3.1 Flash-Lite Preview (Minimal)
Logo de Gemini 3.1 Flash-Lite Preview (Minimal)Google
3.4%
79.9
5.83
Gradium Speech-to-Text
Logo de Gradium Speech-to-TextGradium
6.8%
2.3
13.00
Grok Speech to Text, SpaceXAI
Logo de Grok Speech to Text, SpaceXAISpaceXAI
4.0%
225.0
1.67
Inworld STT 1
Logo de Inworld STT 1Inworld
3.9%
206.9
2.50
Voxtral Mini Transcribe 2
Logo de Voxtral Mini Transcribe 2Mistral
3.6%
82.6
3.00
Voxtral Small
Logo de Voxtral SmallMistral
2.8%
65.7
4.00
Voxtral Mini
Logo de Voxtral MiniDeepInfra
3.8%
79.1
1.00
Modulate STT Batch English VFast
Logo de Modulate STT Batch English VFastModulate
4.2%
61.9
0.42
Parakeet TDT 0.6B V3, Togetherai
Logo de Parakeet TDT 0.6B V3, TogetheraiTogether AI
4.5%
273.1
1.50
Canary Qwen 2.5B, NVIDIA
Logo de Canary Qwen 2.5B, NVIDIAReplicate
4.3%
7.9
0.74
Parakeet TDT 0.6B V2, NVIDIA
Logo de Parakeet TDT 0.6B V2, NVIDIANVIDIA
6.4%
99.9
0.00
Parakeet RNNT 1.1B
Logo de Parakeet RNNT 1.1BReplicate
5.4%
6.3
1.91
GPT Transcribe, OpenAI
Logo de GPT Transcribe, OpenAIOpenAI
3.3%
40.8
4.50
GPT-4o Transcribe
Logo de GPT-4o TranscribeOpenAI
4.0%
37.1
6.00
GPT-4o Mini Transcribe
Logo de GPT-4o Mini TranscribeOpenAI
4.5%
41.4
3.00
Smallest AI Pulse Pro
Logo de Smallest AI Pulse ProSmallest.ai
2.4%
272.9
4.00
Resonant-1
Logo de Resonant-1Reson8
3.4%
331.6
3.60
Rev AI
Logo de Rev AIRev AI
5.9%
12.9
3.33
Smallest AI Pulse
Logo de Smallest AI PulseSmallest.ai
4.4%
274.9
5.00
Soniox v5 Async
Logo de Soniox v5 AsyncSoniox
3.8%
35.1
1.66
Soniox V4
Logo de Soniox V4Soniox
3.9%
39.7
1.66
Speechmatics Melia
Logo de Speechmatics MeliaSpeechmatics
4.9%
204.1
4.00
Speechmatics Standard
Logo de Speechmatics StandardSpeechmatics
5.1%
107.1
7.50
Speechmatics Enhanced
Logo de Speechmatics EnhancedSpeechmatics
4.0%
70.6
12.50
StepAudio 2.5 ASR, StepFun
Logo de StepAudio 2.5 ASR, StepFunStepFun
4.7%
81.5
0.37
Whisper Large v3 Turbo
Logo de Whisper Large v3 TurboGroq
4.6%
130.1
0.67
Wizper Large v3
Logo de Wizper Large v3fal.ai
4.7%
287.6
0.50
Incredibly Fast Whisper
Logo de Incredibly Fast WhisperReplicate
5.7%
55.1
1.49
Whisper Large v3
Logo de Whisper Large v3Replicate
10.1%
2.6
4.23
Whisper Large v3
Logo de Whisper Large v3fal.ai
4.1%
71.8
1.15
Whisper Large v3
Logo de Whisper Large v3Together AI
4.5%
288.1
1.50
Whisper Large v2
Logo de Whisper Large v2OpenAI
4.1%
28.8
6.00

Preguntas frecuentes

Fun-Realtime-ASR-preview lidera con el AA-WER (tasa de error de palabras de Artificial Analysis) más bajo de 1.7% entre 57 modelos evaluados.

Los mejores modelos de voz a texto por precisión (AA-WER) son: 1. Fun-Realtime-ASR-preview (1.7%), 2. Scribe v2, ElevenLabs (2.2%), 3. MAI-Transcribe-1.5 (2.4%), 4. Smallest AI Pulse Pro (2.4%) y 5. Gemini 3.5 Transcribe (2.6%). Un AA-WER más bajo indica mayor precisión de transcripción.

Nova-3 es el más rápido con un factor de velocidad de 501.4x en tiempo real, seguido de Resonant-1 (331.6x) y Whisper Large v3, together.ai (288.1x). Un factor de velocidad más alto significa una transcripción más rápida.

StepAudio 2.5 ASR es el más asequible a $0.3667 por 1.000 minutos, seguido de Modulate STT Batch English VFast ($0.417) y Wizper (L, v3), fal.ai ($0.50).

Voxtral Small, Mistral es el modelo de pesos abiertos más preciso, con un AA-WER de 2.8%. Hay 12 modelos de pesos abiertos de un total de 57 evaluados.

Los mejores modelos de voz a texto de pesos abiertos por precisión son: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) y 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).

El mejor modelo depende de tus prioridades. Usa los gráficos de dispersión para visualizar las compensaciones entre precisión (AA-WER), velocidad y precio. Para aplicaciones que requieren alta precisión, prioriza modelos con puntuaciones AA-WER más bajas. Para aplicaciones en tiempo real, céntrate en el factor de velocidad. Para cargas de trabajo sensibles al costo, compara los gráficos de precios.