Zoom Scribe: benchmarking y análisis de proveedores de API
Análisis de los proveedores de API de Zoom Scribe en métricas de rendimiento, incluido el índice de tasa de error de palabras de Artificial Analysis, la velocidad y el precio.
Destacados
Índice de tasa de error de palabras de Artificial Analysis (AA-WER) por API
Índice de tasa de error de palabras de Artificial Analysis (AA-WER) por API
% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%)
Nota: Para Earnings22, si un modelo no puede manejar de forma fiable audio de duración completa por límites de tiempo, segmentamos en ~9 minutos (relevante para: Nova 2 Pro, Amazon, GPT-4o Transcribe, OpenAI y GPT-4o Mini Transcribe, OpenAI). Para modelos con límites de tiempo aún más cortos, segmentamos en ~30 segundos (relevante para: Canary Qwen 2.5B, NVIDIA).
Benchmarks de API
Índice de tasa de error de palabras de Artificial Analysis vs. precio
% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%) · USD per 1000 minutes of audio
Most attractive quadrant
Factor de velocidad
Factor de velocidad
Input audio seconds transcribed per second · Higher is better
Precio
Precio de transcripción
USD per 1000 minutes of audio
Resumen de métricas clave e información adicional
Proveedor | Más detalles | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 78.5 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 95.2 | 0.00 | ||
Nova 2 Pro | 4.9% | 23.0 | 3.10 | ||
Amazon Transcribe | 4.1% | 16.9 | 6.00 | ||
Universal-3 Pro | 3.1% | 111.7 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 123.1 | 2.50 | ||
MAI-Transcribe-1.5 | 2.4% | 183.3 | 6.00 | ||
MAI-Transcribe-1 | 2.6% | 67.1 | 6.00 | ||
transcribe-03-2026 | 4.6% | 118.7 | 0.00 | ||
Nova-3 | 5.2% | 541.1 | 4.30 | ||
Scribe v2 | 2.2% | 57.0 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 80.0 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 62.8 | 10.16 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 7.0 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 7.4 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 16.6 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 69.0 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 74.5 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 13.3 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 82.3 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Speech to Text, SpaceXAI | 4.0% | 231.1 | 1.67 | ||
Voxtral Mini Transcribe 2 | 3.6% | 85.1 | 3.00 | ||
Voxtral Small | 2.8% | 66.2 | 4.00 | ||
Voxtral Mini | 3.8% | 78.1 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 64.9 | 0.42 | ||
Parakeet TDT 0.6B V3, Togetherai | 4.5% | 292.8 | 1.50 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 5.7 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 98.9 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 38.9 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 38.1 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 43.5 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 274.6 | 4.00 | ||
Resonant-1 | 3.4% | 306.8 | 3.60 | ||
Rev AI | 5.9% | 13.4 | 3.33 | ||
Smallest AI Pulse | 4.4% | 278.7 | 5.00 | ||
Soniox v5 Async | 3.8% | 19.0 | 1.66 | ||
Soniox V4 | 3.9% | 19.4 | 1.66 | ||
Speechmatics Melia | 4.9% | 210.2 | 4.00 | ||
Speechmatics Standard | 5.1% | 104.5 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 71.8 | 12.50 | ||
Whisper Large v3 Turbo | 4.6% | 117.1 | 0.67 | ||
Wizper Large v3 | 4.7% | 154.6 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 55.4 | 1.49 | ||
Whisper Large v3 | 10.1% | 2.7 | 4.23 | ||
Whisper Large v3 | 4.1% | 89.2 | 1.15 | ||
Whisper Large v3 | 4.5% | 311.8 | 1.50 | ||
Whisper Large v2 | 4.1% | 29.6 | 6.00 |