Tabla de clasificación de modelos y proveedores de voz a texto
Compara la tasa de error de palabras, la velocidad y los precios entre modelos y proveedores de voz a texto.
Para más detalles, consulta nuestra página de metodología.
Destacados
Índice de tasa de error de palabras de Artificial Analysis (sin streaming)
Índice de tasa de error de palabras de Artificial Analysis (sin streaming)
AA-WER (sin streaming) por conjunto de datos
AA-WER (sin streaming): conjunto de datos AA-AgentTalk
Comparación de conjuntos de datos limpios
VoxPopuli: subconjunto limpio vs. original de datos disponibles públicamente
Benchmarks de API
Índice de tasa de error de palabras de Artificial Analysis (sin streaming) vs. precio
Factor de velocidad
Precio de transcripción
Resumen de métricas clave e información adicional
Proveedor | Más detalles | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 77.9 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 95.0 | 0.00 | ||
Nova 2 Pro | 4.9% | 22.9 | 3.10 | ||
Amazon Transcribe | 4.1% | 18.8 | 6.00 | ||
Universal-3 Pro | 3.1% | 98.7 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 123.3 | 2.50 | ||
MAI-Transcribe-1.5 | 2.4% | 192.5 | 6.00 | ||
MAI-Transcribe-1 | 2.6% | 67.8 | 6.00 | ||
transcribe-03-2026 | 4.6% | 119.1 | 0.00 | ||
Nova-3 | 5.2% | 501.4 | 4.30 | ||
Scribe v2 | 2.2% | 53.9 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 81.2 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 62.7 | 10.16 | ||
Gemini 3.5 Transcribe | 2.6% | 82.5 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 7.4 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 6.5 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 18.3 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 81.2 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 77.3 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 12.3 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 79.9 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Speech to Text, SpaceXAI | 4.0% | 225.0 | 1.67 | ||
Inworld STT 1 | 3.9% | 206.9 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 82.6 | 3.00 | ||
Voxtral Small | 2.8% | 65.7 | 4.00 | ||
Voxtral Mini | 3.8% | 79.1 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 61.9 | 0.42 | ||
Parakeet TDT 0.6B V3, Togetherai | 4.5% | 273.1 | 1.50 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 7.9 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 99.9 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 40.8 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 37.1 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 41.4 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 272.9 | 4.00 | ||
Resonant-1 | 3.4% | 331.6 | 3.60 | ||
Rev AI | 5.9% | 12.9 | 3.33 | ||
Smallest AI Pulse | 4.4% | 274.9 | 5.00 | ||
Soniox v5 Async | 3.8% | 35.1 | 1.66 | ||
Soniox V4 | 3.9% | 39.7 | 1.66 | ||
Speechmatics Melia | 4.9% | 204.1 | 4.00 | ||
Speechmatics Standard | 5.1% | 107.1 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 70.6 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 81.5 | 0.37 | ||
Whisper Large v3 Turbo | 4.6% | 130.1 | 0.67 | ||
Wizper Large v3 | 4.7% | 287.6 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 55.1 | 1.49 | ||
Whisper Large v3 | 10.1% | 2.6 | 4.23 | ||
Whisper Large v3 | 4.1% | 71.8 | 1.15 | ||
Whisper Large v3 | 4.5% | 288.1 | 1.50 | ||
Whisper Large v2 | 4.1% | 28.8 | 6.00 |
Preguntas frecuentes
Fun-Realtime-ASR-preview lidera con el AA-WER (tasa de error de palabras de Artificial Analysis) más bajo de 1.7% entre 57 modelos evaluados.
Los mejores modelos de voz a texto por precisión (AA-WER) son: 1. Fun-Realtime-ASR-preview (1.7%), 2. Scribe v2, ElevenLabs (2.2%), 3. MAI-Transcribe-1.5 (2.4%), 4. Smallest AI Pulse Pro (2.4%) y 5. Gemini 3.5 Transcribe (2.6%). Un AA-WER más bajo indica mayor precisión de transcripción.
Nova-3 es el más rápido con un factor de velocidad de 501.4x en tiempo real, seguido de Resonant-1 (331.6x) y Whisper Large v3, together.ai (288.1x). Un factor de velocidad más alto significa una transcripción más rápida.
StepAudio 2.5 ASR es el más asequible a $0.3667 por 1.000 minutos, seguido de Modulate STT Batch English VFast ($0.417) y Wizper (L, v3), fal.ai ($0.50).
Voxtral Small, Mistral es el modelo de pesos abiertos más preciso, con un AA-WER de 2.8%. Hay 12 modelos de pesos abiertos de un total de 57 evaluados.
Los mejores modelos de voz a texto de pesos abiertos por precisión son: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) y 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).
El mejor modelo depende de tus prioridades. Usa los gráficos de dispersión para visualizar las compensaciones entre precisión (AA-WER), velocidad y precio. Para aplicaciones que requieren alta precisión, prioriza modelos con puntuaciones AA-WER más bajas. Para aplicaciones en tiempo real, céntrate en el factor de velocidad. Para cargas de trabajo sensibles al costo, compara los gráficos de precios.