Ranking de modelos e provedores de IA de fala para texto

Compare a taxa de erro de palavras, a velocidade e os preços entre modelos e provedores de fala para texto.

Para mais detalhes, consulte nossa página de metodologia.

Destaques

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
USD per 1000 minutes of audio · Lower is better

Índice AA-WER Streaming vs. tempo até a transcrição final

Índice AA-WER Streaming vs. tempo até a transcrição final

% de palavras transcritas incorretamente na transcrição final após o fim da fala detectado vs. segundos até a transcrição final após o fim da fala
Most attractive quadrant
Pareto line

Índice AA-WER Streaming - Transcrição final

% de palavras transcritas incorretamente na transcrição final após o fim da fala detectado

AA-WER Streaming - Transcrição final: conjunto de dados AA-AgentTalk

% de palavras transcritas incorretamente na transcrição final após o fim da fala detectado no conjunto de dados AA-AgentTalk; menor é melhor

Índice AA-WER Streaming (primeira parcial) vs. tempo até a primeira transcrição parcial após o fim da fala

Índice AA-WER Streaming (primeira parcial) vs. tempo até a primeira transcrição parcial após o fim da fala

% de palavras transcritas incorretamente na primeira transcrição parcial após o fim da fala detectado vs. segundos até a primeira transcrição parcial após o fim da fala
Most attractive quadrant
Pareto line

Índice AA-WER Streaming na primeira transcrição parcial após o fim da fala

% de palavras transcritas incorretamente na primeira transcrição parcial após o fim da fala detectado

AA-WER Streaming na primeira transcrição parcial após o fim da fala: conjunto de dados AA-AgentTalk

% de palavras transcritas incorretamente na primeira transcrição parcial após o fim da fala detectado no conjunto de dados AA-AgentTalk; menor é melhor

AA-WER Streaming - Transcrição final comparada com a primeira transcrição parcial após o fim da fala

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)

Latência

Tempo até a transcrição final

Segundos até a transcrição final após o fim da fala

Tempo até a primeira transcrição parcial após o fim da fala

Segundos até a primeira transcrição parcial após o fim da fala

Preço

Preço da transcrição

USD per 1000 minutes of audio