音声文字起こしAIモデル・プロバイダーランキング

音声文字起こしモデルとプロバイダーの単語誤り率、速度、料金を比較します。

詳しくは方法論ページをご覧ください。

注目情報

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
USD per 1000 minutes of audio · Lower is better

AA-WER Streamingインデックス vs. 最終文字起こしまでの時間

AA-WER Streamingインデックス vs. 最終文字起こしまでの時間

検出された発話終了後の最終文字起こしで誤って書き起こされた単語の割合 vs. 発話終了後の最終文字起こしまでの秒数
Most attractive quadrant
Pareto line

AA-WER Streamingインデックス - 最終文字起こし

検出された発話終了後の最終文字起こしで誤って書き起こされた単語の割合

AA-WER Streaming - 最終文字起こし: AA-AgentTalkデータセット

AA-AgentTalkデータセットで検出された発話終了後の最終文字起こしで誤って書き起こされた単語の割合。低いほど良い

AA-WER Streamingインデックス(最初の部分)vs. 発話終了後の最初の部分文字起こしまでの時間

AA-WER Streamingインデックス(最初の部分)vs. 発話終了後の最初の部分文字起こしまでの時間

検出された発話終了後の最初の部分文字起こしで誤って書き起こされた単語の割合 vs. 発話終了後の最初の部分文字起こしまでの秒数
Most attractive quadrant
Pareto line

発話終了後の最初の部分文字起こしにおけるAA-WER Streamingインデックス

検出された発話終了後の最初の部分文字起こしで誤って書き起こされた単語の割合

発話終了後の最初の部分文字起こしにおけるAA-WER Streaming: AA-AgentTalkデータセット

AA-AgentTalkデータセットで検出された発話終了後の最初の部分文字起こしで誤って書き起こされた単語の割合。低いほど良い

AA-WER Streaming - 最終文字起こしと発話終了後の最初の部分文字起こしの比較

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)

レイテンシ

最終文字起こしまでの時間

発話終了後の最終文字起こしまでの秒数

発話終了後の最初の部分文字起こしまでの時間

発話終了後の最初の部分文字起こしまでの秒数

料金

文字起こし料金

USD per 1000 minutes of audio