Tabla de clasificación de modelos y proveedores de voz a texto
Compara la tasa de error de palabras, la velocidad y los precios entre modelos y proveedores de voz a texto.
Para más detalles, consulta nuestra página de metodología.
Destacados
% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
Índice AA-WER Streaming vs. tiempo hasta la transcripción final
Índice AA-WER Streaming vs. tiempo hasta la transcripción final
% de palabras transcritas incorrectamente en la transcripción final tras el final del habla detectado vs. segundos hasta la transcripción final tras el final del habla
Most attractive quadrant
Pareto line
Índice AA-WER Streaming - Transcripción final
% de palabras transcritas incorrectamente en la transcripción final tras el final del habla detectado
AA-WER Streaming - Transcripción final: conjunto de datos AA-AgentTalk
% de palabras transcritas incorrectamente en la transcripción final tras el final del habla detectado en el conjunto de datos AA-AgentTalk; menor es mejor
Índice AA-WER Streaming (primera parcial) vs. tiempo hasta la primera transcripción parcial tras el final del habla
Índice AA-WER Streaming (primera parcial) vs. tiempo hasta la primera transcripción parcial tras el final del habla
% de palabras transcritas incorrectamente en la primera transcripción parcial tras el final del habla detectado vs. segundos hasta la primera transcripción parcial tras el final del habla
Most attractive quadrant
Pareto line
Índice AA-WER Streaming en la primera transcripción parcial tras el final del habla
% de palabras transcritas incorrectamente en la primera transcripción parcial tras el final del habla detectado
AA-WER Streaming en la primera transcripción parcial tras el final del habla: conjunto de datos AA-AgentTalk
% de palabras transcritas incorrectamente en la primera transcripción parcial tras el final del habla detectado en el conjunto de datos AA-AgentTalk; menor es mejor
AA-WER Streaming - Transcripción final comparada con la primera transcripción parcial tras el final del habla
% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Latencia
Tiempo hasta la transcripción final
Segundos hasta la transcripción final tras el final del habla
Tiempo hasta la primera transcripción parcial tras el final del habla
Segundos hasta la primera transcripción parcial tras el final del habla
Precio
Precio de transcripción
USD per 1000 minutes of audio