음성 텍스트 변환 AI 모델 및 제공업체 리더보드
음성 텍스트 변환 모델과 제공업체의 단어 오류율, 속도, 가격을 비교합니다.
자세한 내용은 방법론 페이지를 참조하세요.
Artificial Analysis 단어 오류율 지수(비스트리밍)
Artificial Analysis 단어 오류율 지수(비스트리밍)
AA-WER(비스트리밍) 데이터 세트별
AA-WER(비스트리밍): AA-AgentTalk 데이터 세트
정제 데이터 세트 비교
VoxPopuli: 공개 데이터의 정제 vs. 원본 하위 집합
API 벤치마크
Artificial Analysis 단어 오류율 지수(비스트리밍) vs. 가격
속도 계수
전사 가격
주요 지표 요약 및 추가 정보
제공업체 | 추가 세부 정보 | ||||
|---|---|---|---|---|---|
Qwen3.5 Omni Flash | 13.5% | 78.0 | 0.00 | ||
Qwen3.5 Omni Plus | 3.5% | 175.3 | 0.00 | ||
Fun-Realtime-ASR-preview | 1.7% | 12.3 | 0.00 | ||
Nova 2 Pro | 4.9% | 24.0 | 3.10 | ||
Amazon Transcribe | 4.1% | 28.1 | 6.00 | ||
Universal-3 Pro | 3.1% | 98.4 | 3.50 | ||
Universal, AssemblyAI | 3.8% | 115.6 | 2.50 | ||
MAI-Transcribe-2 | 2.0% | 345.9 | 1.67 | ||
MAI-Transcribe-1.5 | 2.4% | 190.7 | 6.00 | ||
transcribe-03-2026 | 4.6% | 122.6 | 0.00 | ||
Nova-3 | 5.2% | 628.1 | 4.30 | ||
Nova-3, Telnyx | 4.8% | 368.4 | 7.40 | ||
Nova-2, Telnyx | 5.1% | 471.1 | 7.40 | ||
Scribe v2 | 2.2% | 76.5 | 3.67 | ||
Solaria-1, Gladia | 4.1% | 75.0 | 10.17 | ||
Solaria-3, Gladia | 3.2% | 66.5 | 10.16 | ||
Chirp 3, Google | 4.3% | 30.4 | 16.00 | ||
Chirp | 31.2% | 14.8 | 16.00 | ||
Gemini 3.5 Transcribe | 2.6% | 88.6 | 5.00 | ||
Gemini 3.1 Pro Preview (High) | 2.8% | 5.5 | 18.15 | ||
Gemini 3.1 Pro Preview (Low) | 3.6% | 8.3 | 7.72 | ||
Gemini 3 Flash (High) | 2.9% | 22.0 | 13.70 | ||
Gemini 2.5 Flash Lite | 5.2% | 80.0 | 6.56 | ||
Gemini 2.5 Flash | 5.1% | 66.4 | 6.66 | ||
Gemini 2.5 Pro | 2.9% | 12.6 | 11.39 | ||
Gemini 3.1 Flash-Lite Preview (Minimal) | 3.4% | 76.3 | 5.83 | ||
Gradium Speech-to-Text | 6.8% | 2.3 | 13.00 | ||
Grok Voice Transcribe 2.0 | 2.3% | 179.6 | 1.67 | ||
Grok Voice Transcribe 1.0 | 4.0% | 170.3 | 1.67 | ||
Inworld STT 1 | 3.9% | 123.8 | 2.50 | ||
Voxtral Mini Transcribe 2 | 3.6% | 87.1 | 3.00 | ||
Voxtral Small | 2.8% | 66.3 | 4.00 | ||
Voxtral Mini | 3.8% | 48.6 | 1.00 | ||
Modulate STT Batch English VFast | 4.2% | 30.7 | 0.42 | ||
Parakeet TDT 0.6B V3, Togetherai | 4.5% | 195.3 | 1.50 | ||
Canary Qwen 2.5B, NVIDIA | 4.3% | 8.6 | 0.74 | ||
Parakeet TDT 0.6B V2, NVIDIA | 6.4% | 88.9 | 0.00 | ||
Parakeet RNNT 1.1B | 5.4% | 6.3 | 1.91 | ||
GPT Transcribe, OpenAI | 3.3% | 47.9 | 4.50 | ||
GPT-4o Transcribe | 4.0% | 36.0 | 6.00 | ||
GPT-4o Mini Transcribe | 4.5% | 50.4 | 3.00 | ||
Smallest AI Pulse Pro | 2.4% | 260.2 | 4.00 | ||
Resonant-1 | 3.4% | 318.6 | 3.60 | ||
Rev AI | 5.9% | 12.8 | 3.33 | ||
Smallest AI Pulse | 4.4% | 260.2 | 5.00 | ||
Soniox v5 Async | 3.8% | 36.7 | 1.66 | ||
Speechmatics Melia | 4.9% | 175.9 | 4.00 | ||
Speechmatics Standard | 5.1% | 87.6 | 7.50 | ||
Speechmatics Enhanced | 4.0% | 60.0 | 12.50 | ||
StepAudio 2.5 ASR, StepFun | 4.7% | 115.1 | 0.37 | ||
StepAudio 3 ASR, StepFun | 1.7% | 60.8 | 6.67 | ||
Whisper Large v3 Turbo | 4.6% | 183.9 | 0.67 | ||
Whisper Large v3 Turbo, Telnyx | 5.5% | 39.4 | 15.00 | ||
Wizper Large v3 | 4.7% | 260.9 | 0.50 | ||
Incredibly Fast Whisper | 5.7% | 56.7 | 1.49 | ||
Whisper Large v3 | 10.1% | 2.7 | 4.23 | ||
Whisper Large v3 | 4.1% | 75.9 | 1.15 | ||
Whisper Large v3 | 4.5% | 350.7 | 1.50 | ||
Whisper Large v2 | 4.1% | 26.8 | 6.00 |
자주 묻는 질문
StepAudio 3 ASR이(가) 평가된 57개 모델 중 가장 낮은 AA-WER(Artificial Analysis 단어 오류율) 1.7%로 선두입니다.
정확도(AA-WER) 기준 상위 Speech to Text 모델은 다음과 같습니다: 1. StepAudio 3 ASR (1.7%), 2. Fun-Realtime-ASR-preview (1.7%), 3. MAI-Transcribe-2 (2.0%), 4. Scribe v2, ElevenLabs (2.2%) 및 5. Grok Voice Transcribe 2.0 (2.3%). AA-WER이 낮을수록 전사 정확도가 더 높습니다.
Nova-3이(가) 실시간 대비 628.1x의 속도 계수로 가장 빠르며, 그다음이 Nova-2, Telnyx(471.1x), Nova-3, Telnyx(368.4x)입니다. 속도 계수가 높을수록 전사가 더 빠릅니다.
StepAudio 2.5 ASR이(가) 1,000분당 $0.3667로 가장 저렴하며, 그다음이 Modulate STT Batch English VFast($0.417), Wizper (L, v3), fal.ai($0.50)입니다.
Voxtral Small, Mistral이(가) AA-WER 2.8%로 가장 정확한 오픈 웨이트 모델입니다. 평가된 전체 57개 중 오픈 웨이트 모델은 13개입니다.
정확도 기준 상위 오픈 웨이트 Speech to Text 모델은 다음과 같습니다: 1. Voxtral Small, Mistral (AA-WER 2.8%), 2. Inkling (256K), Thinking Machines (AA-WER 3.5%) 및 3. Voxtral Mini Transcribe 2, Mistral (AA-WER 3.6%).
최고의 모델은 우선순위에 따라 달라집니다. 산점도를 사용해 정확도(AA-WER), 속도, 가격 간의 절충을 시각화하세요. 높은 정확도가 필요한 애플리케이션에서는 AA-WER이 낮은 모델을 우선하고, 실시간 애플리케이션에서는 속도 계수에 집중하며, 비용에 민감한 워크로드에서는 가격 차트를 비교하세요.