Bestenliste für Speech-to-Text-KI-Modelle und -Anbieter

Vergleichen Sie Wortfehlerrate, Geschwindigkeit und Preise von Speech-to-Text-Modellen und -Anbietern.

Weitere Einzelheiten finden Sie auf unserer Methodikseite.

Highlights

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
USD per 1000 minutes of audio · Lower is better

AA-WER-Streaming-Index vs. Zeit bis zur finalen Transkription

AA-WER-Streaming-Index vs. Zeit bis zur finalen Transkription

% falsch transkribierter Wörter bei der finalen Transkription nach erkanntem Sprachende vs. Sekunden bis zur finalen Transkription nach Sprachende
Most attractive quadrant
Pareto line

AA-WER-Streaming-Index - Finale Transkription

% falsch transkribierter Wörter bei der finalen Transkription nach erkanntem Sprachende

AA-WER Streaming - Finale Transkription: AA-AgentTalk-Datensatz

% falsch transkribierter Wörter bei der finalen Transkription nach erkanntem Sprachende im AA-AgentTalk-Datensatz; niedriger ist besser

AA-WER-Streaming-Index (erste partielle) vs. Zeit bis zur ersten partiellen Transkription nach Sprachende

AA-WER-Streaming-Index (erste partielle) vs. Zeit bis zur ersten partiellen Transkription nach Sprachende

% falsch transkribierter Wörter bei der ersten partiellen Transkription nach erkanntem Sprachende vs. Sekunden bis zur ersten partiellen Transkription nach Sprachende
Most attractive quadrant
Pareto line

AA-WER-Streaming-Index bei der ersten partiellen Transkription nach Sprachende

% falsch transkribierter Wörter bei der ersten partiellen Transkription nach erkanntem Sprachende

AA-WER Streaming bei der ersten partiellen Transkription nach Sprachende: AA-AgentTalk-Datensatz

% falsch transkribierter Wörter bei der ersten partiellen Transkription nach erkanntem Sprachende im AA-AgentTalk-Datensatz; niedriger ist besser

AA-WER Streaming - Finale Transkription im Vergleich zur ersten partiellen Transkription nach Sprachende

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)

Latenz

Zeit bis zur finalen Transkription

Sekunden bis zur finalen Transkription nach Sprachende

Zeit bis zur ersten partiellen Transkription nach Sprachende

Sekunden bis zur ersten partiellen Transkription nach Sprachende

Preis

Preis der Transkription

USD per 1000 minutes of audio