Tabla de clasificación de modelos y proveedores de voz a texto

Compara la tasa de error de palabras, la velocidad y los precios entre modelos y proveedores de voz a texto.

Para más detalles, consulta nuestra página de metodología.

Destacados

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)
Seconds to final transcript after speech end · weighted average of samples in AA-WER Streaming · Lower is better
USD per 1000 minutes of audio · Lower is better

Índice AA-WER Streaming vs. tiempo hasta la transcripción final

Índice AA-WER Streaming vs. tiempo hasta la transcripción final

% de palabras transcritas incorrectamente en la transcripción final tras el final del habla detectado vs. segundos hasta la transcripción final tras el final del habla
Most attractive quadrant
Pareto line

Índice AA-WER Streaming - Transcripción final

% de palabras transcritas incorrectamente en la transcripción final tras el final del habla detectado

AA-WER Streaming - Transcripción final: conjunto de datos AA-AgentTalk

% de palabras transcritas incorrectamente en la transcripción final tras el final del habla detectado en el conjunto de datos AA-AgentTalk; menor es mejor

Índice AA-WER Streaming (primera parcial) vs. tiempo hasta la primera transcripción parcial tras el final del habla

Índice AA-WER Streaming (primera parcial) vs. tiempo hasta la primera transcripción parcial tras el final del habla

% de palabras transcritas incorrectamente en la primera transcripción parcial tras el final del habla detectado vs. segundos hasta la primera transcripción parcial tras el final del habla
Most attractive quadrant
Pareto line

Índice AA-WER Streaming en la primera transcripción parcial tras el final del habla

% de palabras transcritas incorrectamente en la primera transcripción parcial tras el final del habla detectado

AA-WER Streaming en la primera transcripción parcial tras el final del habla: conjunto de datos AA-AgentTalk

% de palabras transcritas incorrectamente en la primera transcripción parcial tras el final del habla detectado en el conjunto de datos AA-AgentTalk; menor es mejor

AA-WER Streaming - Transcripción final comparada con la primera transcripción parcial tras el final del habla

% of words transcribed incorrectly · Lower is better · AA-WER Streaming incorporates 3 datasets: AA-AgentTalk (50%), VoxPopuli (25%), Earnings22 (25%)

Latencia

Tiempo hasta la transcripción final

Segundos hasta la transcripción final tras el final del habla

Tiempo hasta la primera transcripción parcial tras el final del habla

Segundos hasta la primera transcripción parcial tras el final del habla

Precio

Precio de transcripción

USD per 1000 minutes of audio