音声文字起こしAIモデル・プロバイダーランキング
音声文字起こしモデルとプロバイダーの単語誤り率、速度、料金を比較します。
詳しくは方法論ページをご覧ください。
注目情報
Artificial Analysis単語誤り率インデックス(非ストリーミング)
Artificial Analysis単語誤り率インデックス(非ストリーミング)
AA-WER(非ストリーミング)データセット別
AA-WER(非ストリーミング): AA-AgentTalkデータセット
クリーン済みデータセットの比較
VoxPopuli: 公開データのクリーン済みサブセット vs. オリジナル
APIベンチマーク
Artificial Analysis単語誤り率インデックス(非ストリーミング)vs. 料金
速度係数
文字起こし料金
主要指標の概要と詳細情報
プロバイダー | 詳細情報 | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 75.3 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 95.8 | 0.00 | ||
Fun-Realtime-ASR-preview | 1.7% | 20.5 | 0.00 | ||
Nova 2 Pro | 4.9% | 22.8 | 3.10 | ||
Amazon Transcribe | 4.1% | 32.6 | 6.00 | ||
Universal-3 Pro | 3.1% | 83.4 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 116.1 | 2.50 | ||
MAI-Transcribe-2 | 2.0% | 290.1 | 1.67 | ||
MAI-Transcribe-1.5 | 2.4% | 192.9 | 6.00 | ||
MAI-Transcribe-1 | 2.6% | 68.3 | 6.00 | ||
transcribe-03-2026 | 4.6% | 107.9 | 0.00 | ||
Nova-3 | 5.2% | 541.9 | 4.30 | ||
Nova-3, Telnyx | 4.8% | 417.6 | 7.40 | ||
Nova-2, Telnyx | 5.1% | 459.4 | 7.40 | ||
Scribe v2 | 2.2% | 60.4 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 79.9 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 65.2 | 10.16 | ||
Chirp 3, Google | 4.3% | 30.2 | 16.00 | ||
Chirp | 31.2% | 14.1 | 16.00 | ||
Gemini 3.5 Transcribe | 2.6% | 87.6 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 7.2 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 6.3 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 19.0 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 83.7 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 73.9 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 12.2 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 82.3 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Speech to Text, SpaceXAI | 4.0% | 234.6 | 1.67 | ||
Inworld STT 1 | 3.9% | 157.3 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 84.1 | 3.00 | ||
Voxtral Small | 2.8% | 66.7 | 4.00 | ||
Voxtral Mini | 3.8% | 78.3 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 53.5 | 0.42 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 5.8 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 95.9 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 38.1 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 36.2 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 43.1 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 273.8 | 4.00 | ||
Resonant-1 | 3.4% | 331.7 | 3.60 | ||
Rev AI | 5.9% | 13.0 | 3.33 | ||
Smallest AI Pulse | 4.4% | 289.1 | 5.00 | ||
Soniox v5 Async | 3.8% | 37.1 | 1.66 | ||
Soniox V4 | 3.9% | 44.3 | 1.66 | ||
Speechmatics Melia | 4.9% | 178.2 | 4.00 | ||
Speechmatics Standard | 5.1% | 99.7 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 69.8 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 91.1 | 0.37 | ||
StepAudio 3 ASR, StepFun | 1.7% | 83.7 | 7.00 | ||
Whisper Large v3 Turbo | 4.6% | 145.8 | 0.67 | ||
Whisper Large v3 Turbo, Telnyx | 5.5% | 30.5 | 15.00 | ||
Wizper Large v3 | 4.7% | 287.5 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 56.1 | 1.49 | ||
Whisper Large v3 | 10.1% | 3.0 | 4.23 | ||
Whisper Large v3 | 4.1% | 78.7 | 1.15 | ||
Whisper Large v2 | 4.1% | 29.0 | 6.00 |
よくある質問
Fun-Realtime-ASR-previewは、評価した59モデルのうち最も低いAA-WER(Artificial Analysis単語誤り率)1.7%で首位です。
精度(AA-WER)に基づく上位のSpeech to Textモデルは次のとおりです: 1. Fun-Realtime-ASR-preview(1.7%)、2. StepAudio 3 ASR(1.7%)、3. MAI-Transcribe-2(2.0%)、4. Scribe v2, ElevenLabs(2.2%)、5. MAI-Transcribe-1.5(2.4%)。AA-WERが低いほど文字起こし精度が高いことを示します。
Nova-3が最速で、リアルタイムの541.9xの速度係数です。続いてNova-2, Telnyx(459.4x)、Nova-3, Telnyx(417.6x)です。速度係数が高いほど文字起こしが高速です。
StepAudio 2.5 ASRが最も安価で、1,000分あたり$0.3667です。続いてModulate STT Batch English VFast($0.417)、Wizper (L, v3), fal.ai($0.50)です。
Voxtral Small, Mistralは最も精度の高いオープンウェイトモデルで、AA-WERは2.8%です。評価した合計59モデルのうち、オープンウェイトは12モデルです。
精度に基づく上位のオープンウェイトSpeech to Textモデルは次のとおりです: 1. Voxtral Small, Mistral(AA-WER 2.8%)、2. Inkling (256K), Thinking Machines(AA-WER 3.5%)、3. Voxtral Mini Transcribe 2, Mistral(AA-WER 3.6%)。
最適なモデルは優先事項によって異なります。散布図を使って精度(AA-WER)、速度、料金のトレードオフを可視化してください。高い精度が必要な用途ではAA-WERが低いモデルを優先し、リアルタイム用途では速度係数に注目し、コスト重視のワークロードでは料金チャートを比較してください。