Ranking de modelos e provedores de IA de fala para texto
Compare a taxa de erro de palavras, a velocidade e os preços entre modelos e provedores de fala para texto.
Para mais detalhes, consulte nossa página de metodologia.
Destaques
% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
Índice AA-WER Streaming vs. tempo até a transcrição final
Índice AA-WER Streaming vs. tempo até a transcrição final
% de palavras transcritas incorretamente na transcrição final após o fim da fala detectado vs. segundos até a transcrição final após o fim da fala
Most attractive quadrant
Pareto line
Índice AA-WER Streaming - Transcrição final
% de palavras transcritas incorretamente na transcrição final após o fim da fala detectado
AA-WER Streaming - Transcrição final: conjunto de dados AA-AgentTalk
% de palavras transcritas incorretamente na transcrição final após o fim da fala detectado no conjunto de dados AA-AgentTalk; menor é melhor
Índice AA-WER Streaming (primeira parcial) vs. tempo até a primeira transcrição parcial após o fim da fala
Índice AA-WER Streaming (primeira parcial) vs. tempo até a primeira transcrição parcial após o fim da fala
% de palavras transcritas incorretamente na primeira transcrição parcial após o fim da fala detectado vs. segundos até a primeira transcrição parcial após o fim da fala
Most attractive quadrant
Pareto line
Índice AA-WER Streaming na primeira transcrição parcial após o fim da fala
% de palavras transcritas incorretamente na primeira transcrição parcial após o fim da fala detectado
AA-WER Streaming na primeira transcrição parcial após o fim da fala: conjunto de dados AA-AgentTalk
% de palavras transcritas incorretamente na primeira transcrição parcial após o fim da fala detectado no conjunto de dados AA-AgentTalk; menor é melhor
AA-WER Streaming - Transcrição final comparada com a primeira transcrição parcial após o fim da fala
% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Latência
Tempo até a transcrição final
Segundos até a transcrição final após o fim da fala
Tempo até a primeira transcrição parcial após o fim da fala
Segundos até a primeira transcrição parcial após o fim da fala
Preço
Preço da transcrição
USD per 1000 minutes of audio