Zoom Scribe
Zoom Scribe

Zoom Scribe: benchmarking e análise de provedores de API

Criador:Zoom
Licença:Proprietária
Visitar
Análise dos provedores de API de Zoom Scribe em métricas de desempenho, incluindo o índice de taxa de erro de palavras da Artificial Analysis, velocidade e preço.

Destaques

AA-WER v2 · % of words transcribed incorrectly · Lower is better
Input audio seconds transcribed per second · Higher is better
USD per 1000 minutes of audio · Lower is better

Índice de taxa de erro de palavras da Artificial Analysis (AA-WER) por API

Índice de taxa de erro de palavras da Artificial Analysis (AA-WER) por API

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%)
Observação: Para o Earnings22, se um modelo não conseguir processar áudio completo de forma confiável devido a limites de tempo, dividimos o áudio em segmentos de aproximadamente 9 minutos (modelos relevantes: Nova 2 Pro, Amazon, GPT-4o Transcribe, OpenAI e GPT-4o Mini Transcribe, OpenAI). Para modelos com limites de tempo ainda menores, dividimos o áudio em segmentos de aproximadamente 30 segundos (modelos relevantes: Canary Qwen 2.5B, NVIDIA).

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Benchmarks de API

Índice de taxa de erro de palavras da Artificial Analysis vs. preço

% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%) · USD per 1000 minutes of audio
Most attractive quadrant

Measures transcription accuracy across 3 datasets to evaluate models in real-world speech with diverse accents, domain-specific language, and challenging channel & acoustic conditions.

AA-WER is calculated as an audio-duration-weighted average of WER across ~8 hours from three datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), and Earnings22-Cleaned-AA (25%). See methodology for more detail.

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Fator de velocidade

Fator de velocidade

Input audio seconds transcribed per second · Higher is better

Audio file seconds transcribed per second of processing time. Higher factor indicates faster transcription speed. Reported Speed Factor values are medians across benchmark trials from the last 7 days; over-time chart points are daily medians. Artificial Analysis measurements are based on an audio duration of 10 minutes. Speed Factor may vary for other durations, particularly very short durations under 1 minute.

Preço

Preço da transcrição

USD per 1000 minutes of audio

Estimated cost in USD to transcribe 1,000 minutes of audio, normalized across providers with different billing models, and including billed reasoning tokens where available. Further detail on the methodology page.

Resumo das principais métricas e mais informações

Provedor
Mais detalhes
Qwen3.5 Omni Flash
Logo de Qwen3.5 Omni FlashAlibaba Cloud
13.5%
78.5
0.00
Qwen3.5 Omni Plus
Logo de Qwen3.5 Omni PlusAlibaba Cloud
3.5%
95.2
0.00
Nova 2 Pro
Logo de Nova 2 ProAmazon Bedrock
4.9%
23.0
3.10
Amazon Transcribe
Logo de Amazon TranscribeAmazon Bedrock
4.1%
16.9
6.00
Universal-3 Pro
Logo de Universal-3 ProAssemblyAI
3.1%
111.7
3.50
Universal, AssemblyAI
Logo de Universal, AssemblyAIAssemblyAI
3.8%
123.1
2.50
MAI-Transcribe-1.5
Logo de MAI-Transcribe-1.5Microsoft Azure
2.4%
183.3
6.00
MAI-Transcribe-1
Logo de MAI-Transcribe-1Microsoft Azure
2.6%
67.1
6.00
transcribe-03-2026
Logo de transcribe-03-2026Cohere
4.6%
118.7
0.00
Nova-3
Logo de Nova-3Deepgram
5.2%
541.1
4.30
Scribe v2
Logo de Scribe v2ElevenLabs
2.2%
57.0
3.67
Solaria-1, Gladia
Logo de Solaria-1, GladiaGladia
4.1%
80.0
10.17
Solaria-3, Gladia
Logo de Solaria-3, GladiaGladia
3.2%
62.8
10.16
Gemini 3.1 Pro Preview (High)
Logo de Gemini 3.1 Pro Preview (High)Google
2.8%
7.0
18.15
Gemini 3.1 Pro Preview (Low)
Logo de Gemini 3.1 Pro Preview (Low)Google
3.6%
7.4
7.72
Gemini 3 Flash (High)
Logo de Gemini 3 Flash (High)Google
2.9%
16.6
13.70
Gemini 2.5 Flash Lite
Logo de Gemini 2.5 Flash LiteGoogle
5.2%
69.0
6.56
Gemini 2.5 Flash
Logo de Gemini 2.5 FlashGoogle
5.1%
74.5
6.66
Gemini 2.5 Pro
Logo de Gemini 2.5 ProGoogle
2.9%
13.3
11.39
Gemini 3.1 Flash-Lite Preview (Minimal)
Logo de Gemini 3.1 Flash-Lite Preview (Minimal)Google
3.4%
82.3
5.83
Gradium Speech-to-Text
Logo de Gradium Speech-to-TextGradium
6.8%
2.3
13.00
Grok Speech to Text, SpaceXAI
Logo de Grok Speech to Text, SpaceXAISpaceXAI
4.0%
231.1
1.67
Voxtral Mini Transcribe 2
Logo de Voxtral Mini Transcribe 2Mistral
3.6%
85.1
3.00
Voxtral Small
Logo de Voxtral SmallMistral
2.8%
66.2
4.00
Voxtral Mini
Logo de Voxtral MiniDeepInfra
3.8%
78.1
1.00
Modulate STT Batch English VFast
Logo de Modulate STT Batch English VFastModulate
4.2%
64.9
0.42
Parakeet TDT 0.6B V3, Togetherai
Logo de Parakeet TDT 0.6B V3, TogetheraiTogether AI
4.5%
292.8
1.50
Canary Qwen 2.5B, NVIDIA
Logo de Canary Qwen 2.5B, NVIDIAReplicate
4.3%
5.7
0.74
Parakeet TDT 0.6B V2, NVIDIA
Logo de Parakeet TDT 0.6B V2, NVIDIANVIDIA
6.4%
98.9
0.00
Parakeet RNNT 1.1B
Logo de Parakeet RNNT 1.1BReplicate
5.4%
6.3
1.91
GPT Transcribe, OpenAI
Logo de GPT Transcribe, OpenAIOpenAI
3.3%
38.9
4.50
GPT-4o Transcribe
Logo de GPT-4o TranscribeOpenAI
4.0%
38.1
6.00
GPT-4o Mini Transcribe
Logo de GPT-4o Mini TranscribeOpenAI
4.5%
43.5
3.00
Smallest AI Pulse Pro
Logo de Smallest AI Pulse ProSmallest.ai
2.4%
274.6
4.00
Resonant-1
Logo de Resonant-1Reson8
3.4%
306.8
3.60
Rev AI
Logo de Rev AIRev AI
5.9%
13.4
3.33
Smallest AI Pulse
Logo de Smallest AI PulseSmallest.ai
4.4%
278.7
5.00
Soniox v5 Async
Logo de Soniox v5 AsyncSoniox
3.8%
19.0
1.66
Soniox V4
Logo de Soniox V4Soniox
3.9%
19.4
1.66
Speechmatics Melia
Logo de Speechmatics MeliaSpeechmatics
4.9%
210.2
4.00
Speechmatics Standard
Logo de Speechmatics StandardSpeechmatics
5.1%
104.5
7.50
Speechmatics Enhanced
Logo de Speechmatics EnhancedSpeechmatics
4.0%
71.8
12.50
Whisper Large v3 Turbo
Logo de Whisper Large v3 TurboGroq
4.6%
117.1
0.67
Wizper Large v3
Logo de Wizper Large v3fal.ai
4.7%
154.6
0.50
Incredibly Fast Whisper
Logo de Incredibly Fast WhisperReplicate
5.7%
55.4
1.49
Whisper Large v3
Logo de Whisper Large v3Replicate
10.1%
2.7
4.23
Whisper Large v3
Logo de Whisper Large v3fal.ai
4.1%
89.2
1.15
Whisper Large v3
Logo de Whisper Large v3Together AI
4.5%
311.8
1.50
Whisper Large v2
Logo de Whisper Large v2OpenAI
4.1%
29.6
6.00