亮点
Artificial Analysis 词错误率指数(非流式)
Artificial Analysis 词错误率指数(非流式)
AA-WER(非流式)按数据集
AA-WER(非流式):AA-AgentTalk 数据集
清洗数据集对比
VoxPopuli:公开数据的清洗子集 vs. 原始子集
API 基准测试
Artificial Analysis 词错误率指数(非流式)vs. 价格
速度因子
转写价格
关键指标摘要与更多信息
服务商 | 更多详情 | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 77.7 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 95.0 | 0.00 | ||
Nova 2 Pro | 4.9% | 22.9 | 3.10 | ||
Amazon Transcribe | 4.1% | 18.8 | 6.00 | ||
Universal-3 Pro | 3.1% | 98.7 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 123.2 | 2.50 | ||
MAI-Transcribe-1.5 | 2.4% | 192.5 | 6.00 | ||
MAI-Transcribe-1 | 2.6% | 67.6 | 6.00 | ||
transcribe-03-2026 | 4.6% | 119.1 | 0.00 | ||
Nova-3 | 5.2% | 545.1 | 4.30 | ||
Scribe v2 | 2.2% | 52.3 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 81.2 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 63.0 | 10.16 | ||
Gemini 3.5 Transcribe | 2.6% | 79.6 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 7.3 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 6.5 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 18.3 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 83.3 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 78.3 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 12.3 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 80.1 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Speech to Text, SpaceXAI | 4.0% | 226.4 | 1.67 | ||
Inworld STT 1 | 3.9% | 206.1 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 83.1 | 3.00 | ||
Voxtral Small | 2.8% | 66.3 | 4.00 | ||
Voxtral Mini | 3.8% | 79.3 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 61.9 | 0.42 | ||
Parakeet TDT 0.6B V3, Togetherai | 4.5% | 274.9 | 1.50 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 6.7 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 100.1 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 40.8 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 37.1 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 40.6 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 272.4 | 4.00 | ||
Resonant-1 | 3.4% | 332.2 | 3.60 | ||
Rev AI | 5.9% | 12.9 | 3.33 | ||
Smallest AI Pulse | 4.4% | 278.3 | 5.00 | ||
Soniox v5 Async | 3.8% | 36.8 | 1.66 | ||
Soniox V4 | 3.9% | 39.7 | 1.66 | ||
Speechmatics Melia | 4.9% | 206.8 | 4.00 | ||
Speechmatics Standard | 5.1% | 107.1 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 73.3 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 81.8 | 0.37 | ||
Whisper Large v3 Turbo | 4.6% | 130.1 | 0.67 | ||
Wizper Large v3 | 4.7% | 287.6 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 55.0 | 1.49 | ||
Whisper Large v3 | 10.1% | 2.6 | 4.23 | ||
Whisper Large v3 | 4.1% | 71.2 | 1.15 | ||
Whisper Large v3 | 4.5% | 289.6 | 1.50 | ||
Whisper Large v2 | 4.1% | 29.0 | 6.00 |
常见问题
Fun-Realtime-ASR-preview 以最低的 AA-WER(Artificial Analysis 词错误率)1.7% 在 57 个已评估模型中领先。
按准确度(AA-WER)排名的顶级语音转文本模型为:1. Fun-Realtime-ASR-preview(1.7%)、2. Scribe v2, ElevenLabs(2.2%)、3. MAI-Transcribe-1.5(2.4%)、4. Smallest AI Pulse Pro(2.4%)和5. Gemini 3.5 Transcribe(2.6%)。AA-WER 越低,表示转写准确度越高。
Nova-3 最快,速度因子为实时的 545.1x,其次是 Resonant-1(332.2x)和 Whisper Large v3, together.ai(289.6x)。速度因子越高,转写越快。
StepAudio 2.5 ASR 最实惠,价格为每 1,000 分钟 $0.3667,其次是 Modulate STT Batch English VFast($0.417)和 Wizper (L, v3), fal.ai($0.50)。
Voxtral Small, Mistral 是最准确的开放权重模型,AA-WER 为 2.8%。在总共 57 个已评估模型中,有 12 个开放权重模型。
按准确度排名的顶级开放权重语音转文本模型为:1. Voxtral Small, Mistral(AA-WER 2.8%)、2. Inkling (256K), Thinking Machines(AA-WER 3.5%)和3. Voxtral Mini Transcribe 2, Mistral(AA-WER 3.6%)。
最佳模型取决于你的优先级。使用散点图可视化准确度(AA-WER)、速度与价格之间的权衡。对于需要高准确度的应用,优先选择 AA-WER 更低的模型;对于实时应用,关注速度因子;对于成本敏感的工作负载,比较价格图表。