Bestenliste für Speech-to-Text-KI-Modelle und -Anbieter
Vergleichen Sie Wortfehlerrate, Geschwindigkeit und Preise von Speech-to-Text-Modellen und -Anbietern.
Weitere Einzelheiten finden Sie auf unserer Methodikseite.
Highlights
% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
AA-WER-Streaming-Index vs. Zeit bis zur finalen Transkription
AA-WER-Streaming-Index vs. Zeit bis zur finalen Transkription
% falsch transkribierter Wörter bei der finalen Transkription nach erkanntem Sprachende vs. Sekunden bis zur finalen Transkription nach Sprachende
Most attractive quadrant
Pareto line
AA-WER-Streaming-Index - Finale Transkription
% falsch transkribierter Wörter bei der finalen Transkription nach erkanntem Sprachende
AA-WER Streaming - Finale Transkription: AA-AgentTalk-Datensatz
% falsch transkribierter Wörter bei der finalen Transkription nach erkanntem Sprachende im AA-AgentTalk-Datensatz; niedriger ist besser
AA-WER-Streaming-Index (erste partielle) vs. Zeit bis zur ersten partiellen Transkription nach Sprachende
AA-WER-Streaming-Index (erste partielle) vs. Zeit bis zur ersten partiellen Transkription nach Sprachende
% falsch transkribierter Wörter bei der ersten partiellen Transkription nach erkanntem Sprachende vs. Sekunden bis zur ersten partiellen Transkription nach Sprachende
Most attractive quadrant
Pareto line
AA-WER-Streaming-Index bei der ersten partiellen Transkription nach Sprachende
% falsch transkribierter Wörter bei der ersten partiellen Transkription nach erkanntem Sprachende
AA-WER Streaming bei der ersten partiellen Transkription nach Sprachende: AA-AgentTalk-Datensatz
% falsch transkribierter Wörter bei der ersten partiellen Transkription nach erkanntem Sprachende im AA-AgentTalk-Datensatz; niedriger ist besser
AA-WER Streaming - Finale Transkription im Vergleich zur ersten partiellen Transkription nach Sprachende
% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Latenz
Zeit bis zur finalen Transkription
Sekunden bis zur finalen Transkription nach Sprachende
Zeit bis zur ersten partiellen Transkription nach Sprachende
Sekunden bis zur ersten partiellen Transkription nach Sprachende
Preis
Preis der Transkription
USD per 1000 minutes of audio