Ranking de modelos e provedores de IA de fala para texto

Compare a taxa de erro de palavras, a velocidade e os preços entre modelos e provedores de fala para texto.

Para mais detalhes, consulte nossa página de metodologia.

Destaques

AA-WER v2 · % of words transcribed incorrectly · Lower is better
Input audio seconds transcribed per second · Higher is better
USD per 1000 minutes of audio · Lower is better

Índice de taxa de erro de palavras da Artificial Analysis (sem streaming)

Índice de taxa de erro de palavras da Artificial Analysis (sem streaming)

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%)
Observação: Para o Earnings22, se um modelo não conseguir processar áudio completo de forma confiável devido a limites de tempo, dividimos o áudio em segmentos de aproximadamente 9 minutos (modelos relevantes: GPT-4o Mini Transcribe, OpenAI, Nova 2 Pro, Amazon e GPT-4o Transcribe, OpenAI). Para modelos com limites de tempo ainda menores, dividimos o áudio em segmentos de aproximadamente 30 segundos (modelos relevantes: Inworld STT 1, Canary Qwen 2.5B, NVIDIA e Qwen3 ASR Flash, Alibaba).

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

AA-WER (sem streaming) por conjunto de dados

AA-WER (sem streaming): conjunto de dados AA-AgentTalk

% of words transcribed incorrectly on the AA-AgentTalk dataset · Lower is better

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Comparação de conjuntos de dados limpos

VoxPopuli: subconjunto limpo vs. original de dados disponíveis publicamente

% WER (word error rate) · Lower is better
Ordenar por
Observação: As versões limpas removem erros de transcrição do texto de referência, fornecendo uma verdade de base mais precisa para a avaliação dos modelos.

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Benchmarks de API

Índice de taxa de erro de palavras da Artificial Analysis (sem streaming) vs. preço

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%) · USD per 1000 minutes of audio
Most attractive quadrant

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Fator de velocidade

Input audio seconds transcribed per second · Higher is better

Audio file seconds transcribed per second of processing time. Higher factor indicates faster transcription speed. Reported Speed Factor values are medians across benchmark trials from the last 7 days; over-time chart points are daily medians. Artificial Analysis measurements are based on an audio duration of 10 minutes. Speed Factor may vary for other durations, particularly very short durations under 1 minute.

Preço da transcrição

USD per 1000 minutes of audio

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Resumo das principais métricas e mais informações

Provedor
Mais detalhes
Qwen3.5 Omni Flash
Logo de Qwen3.5 Omni FlashAlibaba Cloud
13.5%
77.9
0.00
Qwen3.5 Omni Plus
Logo de Qwen3.5 Omni PlusAlibaba Cloud
3.5%
95.0
0.00
Nova 2 Pro
Logo de Nova 2 ProAmazon Bedrock
4.9%
22.9
3.10
Amazon Transcribe
Logo de Amazon TranscribeAmazon Bedrock
4.1%
18.8
6.00
Universal-3 Pro
Logo de Universal-3 ProAssemblyAI
3.1%
98.7
3.50
Universal, AssemblyAI
Logo de Universal, AssemblyAIAssemblyAI
3.8%
123.3
2.50
MAI-Transcribe-1.5
Logo de MAI-Transcribe-1.5Microsoft Azure
2.4%
192.5
6.00
MAI-Transcribe-1
Logo de MAI-Transcribe-1Microsoft Azure
2.6%
67.8
6.00
transcribe-03-2026
Logo de transcribe-03-2026Cohere
4.6%
119.1
0.00
Nova-3
Logo de Nova-3Deepgram
5.2%
501.4
4.30
Scribe v2
Logo de Scribe v2ElevenLabs
2.2%
53.9
3.67
Solaria-1, Gladia
Logo de Solaria-1, GladiaGladia
4.1%
81.2
10.17
Solaria-3, Gladia
Logo de Solaria-3, GladiaGladia
3.2%
62.7
10.16
Gemini 3.5 Transcribe
Logo de Gemini 3.5 TranscribeGoogle
2.6%
82.5
5.00
Gemini 3.1 Pro Preview (High)
Logo de Gemini 3.1 Pro Preview (High)Google
2.8%
7.4
18.15
Gemini 3.1 Pro Preview (Low)
Logo de Gemini 3.1 Pro Preview (Low)Google
3.6%
6.5
7.72
Gemini 3 Flash (High)
Logo de Gemini 3 Flash (High)Google
2.9%
18.3
13.70
Gemini 2.5 Flash Lite
Logo de Gemini 2.5 Flash LiteGoogle
5.2%
81.2
6.56
Gemini 2.5 Flash
Logo de Gemini 2.5 FlashGoogle
5.1%
77.3
6.66
Gemini 2.5 Pro
Logo de Gemini 2.5 ProGoogle
2.9%
12.3
11.39
Gemini 3.1 Flash-Lite Preview (Minimal)
Logo de Gemini 3.1 Flash-Lite Preview (Minimal)Google
3.4%
79.9
5.83
Gradium Speech-to-Text
Logo de Gradium Speech-to-TextGradium
6.8%
2.3
13.00
Grok Speech to Text, SpaceXAI
Logo de Grok Speech to Text, SpaceXAISpaceXAI
4.0%
225.0
1.67
Inworld STT 1
Logo de Inworld STT 1Inworld
3.9%
206.9
2.50
Voxtral Mini Transcribe 2
Logo de Voxtral Mini Transcribe 2Mistral
3.6%
82.6
3.00
Voxtral Small
Logo de Voxtral SmallMistral
2.8%
65.7
4.00
Voxtral Mini
Logo de Voxtral MiniDeepInfra
3.8%
79.1
1.00
Modulate STT Batch English VFast
Logo de Modulate STT Batch English VFastModulate
4.2%
61.9
0.42
Parakeet TDT 0.6B V3, Togetherai
Logo de Parakeet TDT 0.6B V3, TogetheraiTogether AI
4.5%
273.1
1.50
Canary Qwen 2.5B, NVIDIA
Logo de Canary Qwen 2.5B, NVIDIAReplicate
4.3%
7.9
0.74
Parakeet TDT 0.6B V2, NVIDIA
Logo de Parakeet TDT 0.6B V2, NVIDIANVIDIA
6.4%
99.9
0.00
Parakeet RNNT 1.1B
Logo de Parakeet RNNT 1.1BReplicate
5.4%
6.3
1.91
GPT Transcribe, OpenAI
Logo de GPT Transcribe, OpenAIOpenAI
3.3%
40.8
4.50
GPT-4o Transcribe
Logo de GPT-4o TranscribeOpenAI
4.0%
37.1
6.00
GPT-4o Mini Transcribe
Logo de GPT-4o Mini TranscribeOpenAI
4.5%
41.4
3.00
Smallest AI Pulse Pro
Logo de Smallest AI Pulse ProSmallest.ai
2.4%
272.9
4.00
Resonant-1
Logo de Resonant-1Reson8
3.4%
331.6
3.60
Rev AI
Logo de Rev AIRev AI
5.9%
12.9
3.33
Smallest AI Pulse
Logo de Smallest AI PulseSmallest.ai
4.4%
274.9
5.00
Soniox v5 Async
Logo de Soniox v5 AsyncSoniox
3.8%
35.1
1.66
Soniox V4
Logo de Soniox V4Soniox
3.9%
39.7
1.66
Speechmatics Melia
Logo de Speechmatics MeliaSpeechmatics
4.9%
204.1
4.00
Speechmatics Standard
Logo de Speechmatics StandardSpeechmatics
5.1%
107.1
7.50
Speechmatics Enhanced
Logo de Speechmatics EnhancedSpeechmatics
4.0%
70.6
12.50
StepAudio 2.5 ASR, StepFun
Logo de StepAudio 2.5 ASR, StepFunStepFun
4.7%
81.5
0.37
Whisper Large v3 Turbo
Logo de Whisper Large v3 TurboGroq
4.6%
130.1
0.67
Wizper Large v3
Logo de Wizper Large v3fal.ai
4.7%
287.6
0.50
Incredibly Fast Whisper
Logo de Incredibly Fast WhisperReplicate
5.7%
55.1
1.49
Whisper Large v3
Logo de Whisper Large v3Replicate
10.1%
2.6
4.23
Whisper Large v3
Logo de Whisper Large v3fal.ai
4.1%
71.8
1.15
Whisper Large v3
Logo de Whisper Large v3Together AI
4.5%
288.1
1.50
Whisper Large v2
Logo de Whisper Large v2OpenAI
4.1%
28.8
6.00

Perguntas frequentes

Fun-Realtime-ASR-preview lidera com o menor AA-WER (taxa de erro de palavras da Artificial Analysis) de 1.7% entre 57 modelos avaliados.

Os principais modelos de voz para texto por precisão (AA-WER) são: 1. Fun-Realtime-ASR-preview (1.7%), 2. Scribe v2, ElevenLabs (2.2%), 3. MAI-Transcribe-1.5 (2.4%), 4. Smallest AI Pulse Pro (2.4%) e 5. Gemini 3.5 Transcribe (2.6%). Um AA-WER menor indica melhor precisão de transcrição.

Nova-3 é o mais rápido com um fator de velocidade de 501.4x em tempo real, seguido por Resonant-1 (331.6x) e Whisper Large v3, together.ai (288.1x). Fatores de velocidade mais altos significam transcrição mais rápida.

StepAudio 2.5 ASR é o mais acessível a $0.3667 por 1.000 minutos, seguido por Modulate STT Batch English VFast ($0.417) e Wizper (L, v3), fal.ai ($0.50).

Voxtral Small, Mistral é o modelo de pesos abertos mais preciso, com um AA-WER de 2.8%. Há 12 modelos de pesos abertos de um total de 57 avaliados.

Os principais modelos de voz para texto de pesos abertos por precisão são: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) e 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).

O melhor modelo depende das suas prioridades. Use os gráficos de dispersão para visualizar as compensações entre precisão (AA-WER), velocidade e preço. Para aplicações que exigem alta precisão, priorize modelos com pontuações AA-WER mais baixas. Para aplicações em tempo real, foque no fator de velocidade. Para cargas sensíveis a custo, compare os gráficos de preços.