Ranking de modelos e provedores de IA de fala para texto
Compare a taxa de erro de palavras, a velocidade e os preços entre modelos e provedores de fala para texto.
Para mais detalhes, consulte nossa página de metodologia.
Destaques
Índice de taxa de erro de palavras da Artificial Analysis (sem streaming)
Índice de taxa de erro de palavras da Artificial Analysis (sem streaming)
AA-WER (sem streaming) por conjunto de dados
AA-WER (sem streaming): conjunto de dados AA-AgentTalk
Comparação de conjuntos de dados limpos
VoxPopuli: subconjunto limpo vs. original de dados disponíveis publicamente
Benchmarks de API
Índice de taxa de erro de palavras da Artificial Analysis (sem streaming) vs. preço
Fator de velocidade
Preço da transcrição
Resumo das principais métricas e mais informações
Provedor | Mais detalhes | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 77.9 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 95.0 | 0.00 | ||
Nova 2 Pro | 4.9% | 22.9 | 3.10 | ||
Amazon Transcribe | 4.1% | 18.8 | 6.00 | ||
Universal-3 Pro | 3.1% | 98.7 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 123.3 | 2.50 | ||
MAI-Transcribe-1.5 | 2.4% | 192.5 | 6.00 | ||
MAI-Transcribe-1 | 2.6% | 67.8 | 6.00 | ||
transcribe-03-2026 | 4.6% | 119.1 | 0.00 | ||
Nova-3 | 5.2% | 501.4 | 4.30 | ||
Scribe v2 | 2.2% | 53.9 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 81.2 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 62.7 | 10.16 | ||
Gemini 3.5 Transcribe | 2.6% | 82.5 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 7.4 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 6.5 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 18.3 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 81.2 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 77.3 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 12.3 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 79.9 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Speech to Text, SpaceXAI | 4.0% | 225.0 | 1.67 | ||
Inworld STT 1 | 3.9% | 206.9 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 82.6 | 3.00 | ||
Voxtral Small | 2.8% | 65.7 | 4.00 | ||
Voxtral Mini | 3.8% | 79.1 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 61.9 | 0.42 | ||
Parakeet TDT 0.6B V3, Togetherai | 4.5% | 273.1 | 1.50 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 7.9 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 99.9 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 40.8 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 37.1 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 41.4 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 272.9 | 4.00 | ||
Resonant-1 | 3.4% | 331.6 | 3.60 | ||
Rev AI | 5.9% | 12.9 | 3.33 | ||
Smallest AI Pulse | 4.4% | 274.9 | 5.00 | ||
Soniox v5 Async | 3.8% | 35.1 | 1.66 | ||
Soniox V4 | 3.9% | 39.7 | 1.66 | ||
Speechmatics Melia | 4.9% | 204.1 | 4.00 | ||
Speechmatics Standard | 5.1% | 107.1 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 70.6 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 81.5 | 0.37 | ||
Whisper Large v3 Turbo | 4.6% | 130.1 | 0.67 | ||
Wizper Large v3 | 4.7% | 287.6 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 55.1 | 1.49 | ||
Whisper Large v3 | 10.1% | 2.6 | 4.23 | ||
Whisper Large v3 | 4.1% | 71.8 | 1.15 | ||
Whisper Large v3 | 4.5% | 288.1 | 1.50 | ||
Whisper Large v2 | 4.1% | 28.8 | 6.00 |
Perguntas frequentes
Fun-Realtime-ASR-preview lidera com o menor AA-WER (taxa de erro de palavras da Artificial Analysis) de 1.7% entre 57 modelos avaliados.
Os principais modelos de voz para texto por precisão (AA-WER) são: 1. Fun-Realtime-ASR-preview (1.7%), 2. Scribe v2, ElevenLabs (2.2%), 3. MAI-Transcribe-1.5 (2.4%), 4. Smallest AI Pulse Pro (2.4%) e 5. Gemini 3.5 Transcribe (2.6%). Um AA-WER menor indica melhor precisão de transcrição.
Nova-3 é o mais rápido com um fator de velocidade de 501.4x em tempo real, seguido por Resonant-1 (331.6x) e Whisper Large v3, together.ai (288.1x). Fatores de velocidade mais altos significam transcrição mais rápida.
StepAudio 2.5 ASR é o mais acessível a $0.3667 por 1.000 minutos, seguido por Modulate STT Batch English VFast ($0.417) e Wizper (L, v3), fal.ai ($0.50).
Voxtral Small, Mistral é o modelo de pesos abertos mais preciso, com um AA-WER de 2.8%. Há 12 modelos de pesos abertos de um total de 57 avaliados.
Os principais modelos de voz para texto de pesos abertos por precisão são: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) e 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).
O melhor modelo depende das suas prioridades. Use os gráficos de dispersão para visualizar as compensações entre precisão (AA-WER), velocidade e preço. Para aplicações que exigem alta precisão, priorize modelos com pontuações AA-WER mais baixas. Para aplicações em tempo real, foque no fator de velocidade. Para cargas sensíveis a custo, compare os gráficos de preços.