
Speechmatics Agent STT: API 제공업체 벤치마킹 및 분석
Artificial Analysis 단어 오류율 지수, 속도, 가격을 포함한 성능 지표에서 Speechmatics Agent STT API 제공업체 분석.
주요 내용
API별 Artificial Analysis 단어 오류율(AA-WER) 지수
API별 Artificial Analysis 단어 오류율(AA-WER) 지수
% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%)
참고: Earnings22에서 시간 제한으로 인해 모델이 전체 길이의 오디오를 안정적으로 처리할 수 없는 경우 약 9분 단위로 분할합니다(해당 모델: Nova 2 Pro, Amazon GPT-4o Transcribe, OpenAI GPT-4o Mini Transcribe, OpenAI). 시간 제한이 더 짧은 모델은 약 30초 단위로 분할합니다(해당 모델: Canary Qwen 2.5B, NVIDIA Inworld STT 1).
API 벤치마크
Artificial Analysis 단어 오류율 지수 vs. 가격
% of words transcribed incorrectly · Lower is better · AA-WER v2 incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli-Cleaned-AA (25%), Earnings22-Cleaned-AA (25%) · USD per 1000 minutes of audio
Most attractive quadrant
속도 계수
속도 계수
Input audio seconds transcribed per second · Higher is better
가격
전사 가격
USD per 1000 minutes of audio
주요 지표 요약 및 추가 정보
제공업체 | 추가 세부 정보 | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 75.5 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 96.2 | 0.00 | ||
Fun-Realtime-ASR-preview | 1.7% | 20.4 | 0.00 | ||
Nova 2 Pro | 4.9% | 22.8 | 3.10 | ||
Amazon Transcribe | 4.1% | 31.9 | 6.00 | ||
Universal-3 Pro | 3.1% | 90.7 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 118.4 | 2.50 | ||
MAI-Transcribe-2 | 2.0% | 323.6 | 1.67 | ||
MAI-Transcribe-1.5 | 2.4% | 193.9 | 6.00 | ||
MAI-Transcribe-1 | 2.6% | 68.4 | 6.00 | ||
transcribe-03-2026 | 4.6% | 107.9 | 0.00 | ||
Nova-3 | 5.2% | 541.9 | 4.30 | ||
Nova-3, Telnyx | 4.8% | 419.4 | 7.40 | ||
Nova-2, Telnyx | 5.1% | 427.0 | 7.40 | ||
Scribe v2 | 2.2% | 62.8 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 80.9 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 81.1 | 10.16 | ||
Chirp 3, Google | 4.3% | 30.4 | 16.00 | ||
Chirp | 31.2% | 14.1 | 16.00 | ||
Gemini 3.5 Transcribe | 2.6% | 89.1 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 6.8 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 6.6 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 19.8 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 84.0 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 73.3 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 12.3 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 81.8 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Voice Transcribe 2.0 | 2.3% | 161.5 | 1.67 | ||
Grok Voice Transcribe 1.0 | 4.0% | 237.3 | 1.67 | ||
Inworld STT 1 | 3.9% | 158.5 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 83.0 | 3.00 | ||
Voxtral Small | 2.8% | 66.6 | 4.00 | ||
Voxtral Mini | 3.8% | 75.1 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 53.6 | 0.42 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 7.7 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 98.7 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 40.8 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 36.3 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 43.1 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 277.5 | 4.00 | ||
Resonant-1 | 3.4% | 325.6 | 3.60 | ||
Rev AI | 5.9% | 12.7 | 3.33 | ||
Smallest AI Pulse | 4.4% | 288.6 | 5.00 | ||
Soniox v5 Async | 3.8% | 36.9 | 1.66 | ||
Soniox V4 | 3.9% | 44.2 | 1.66 | ||
Speechmatics Melia | 4.9% | 173.7 | 4.00 | ||
Speechmatics Standard | 5.1% | 97.9 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 69.8 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 124.0 | 0.37 | ||
StepAudio 3 ASR, StepFun | 1.7% | 84.9 | 7.00 | ||
Whisper Large v3 Turbo | 4.6% | 124.3 | 0.67 | ||
Whisper Large v3 Turbo, Telnyx | 5.5% | 30.8 | 15.00 | ||
Wizper Large v3 | 4.7% | 267.1 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 56.1 | 1.49 | ||
Whisper Large v3 | 10.1% | 3.0 | 4.23 | ||
Whisper Large v3 | 4.1% | 95.7 | 1.15 | ||
Whisper Large v2 | 4.1% | 29.4 | 6.00 |