음성 텍스트 변환 AI 모델 및 제공업체 리더보드

음성 텍스트 변환 모델과 제공업체의 단어 오류율, 속도, 가격을 비교합니다.

자세한 내용은 방법론 페이지를 참조하세요.

주요 내용

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
USD per 1000 minutes of audio · Lower is better

AA-WER Streaming 지수 vs. 최종 전사까지 시간

AA-WER Streaming 지수 vs. 최종 전사까지 시간

감지된 발화 종료 후 최종 전사에서 잘못 전사된 단어 비율 vs. 발화 종료 후 최종 전사까지 초
Most attractive quadrant
Pareto line

AA-WER Streaming 지수 - 최종 전사

감지된 발화 종료 후 최종 전사에서 잘못 전사된 단어 비율

AA-WER Streaming - 최종 전사: AA-AgentTalk 데이터 세트

AA-AgentTalk 데이터 세트에서 감지된 발화 종료 후 최종 전사에서 잘못 전사된 단어 비율. 낮을수록 좋음

AA-WER Streaming 지수(첫 부분) vs. 발화 종료 후 첫 부분 전사까지 시간

AA-WER Streaming 지수(첫 부분) vs. 발화 종료 후 첫 부분 전사까지 시간

감지된 발화 종료 후 첫 부분 전사에서 잘못 전사된 단어 비율 vs. 발화 종료 후 첫 부분 전사까지 초
Most attractive quadrant
Pareto line

발화 종료 후 첫 부분 전사에서의 AA-WER Streaming 지수

감지된 발화 종료 후 첫 부분 전사에서 잘못 전사된 단어 비율

발화 종료 후 첫 부분 전사에서의 AA-WER Streaming: AA-AgentTalk 데이터 세트

AA-AgentTalk 데이터 세트에서 감지된 발화 종료 후 첫 부분 전사에서 잘못 전사된 단어 비율. 낮을수록 좋음

AA-WER Streaming - 최종 전사와 발화 종료 후 첫 부분 전사 비교

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)

지연 시간

최종 전사까지 시간

발화 종료 후 최종 전사까지 초

발화 종료 후 첫 부분 전사까지 시간

발화 종료 후 첫 부분 전사까지 초

가격

전사 가격

USD per 1000 minutes of audio