Mejores modelos de texto a voz (TTS) con voces de proveedores
Compara la calidad, la velocidad y el precio de modelos de generación de voz usando, cuando estén disponibles, las voces nativas propias de cada modelo.
Para más detalles, consulta nuestra página de metodología.
CalidadUpdated
Elo de preferencia de la Arena de voces de proveedores
Robustez de pronunciación
Robustez de pronunciación por categoría
Precios
Precio
Rendimiento
Caracteres por segundo
Preguntas frecuentes
Sonic 3.6 tiene actualmente la mayor calidad en la comparación de modelos de texto a voz de Artificial Analysis, con un Elo de calidad de 1273. Ver Sonic 3.6
Polly Standard es actualmente el modelo de texto a voz más rápido de la comparación en endpoints de API representativos, con Amazon Bedrock entregando 1244,8 caracteres por segundo. Ver proveedores de Polly Standard
Kokoro 82M v1.0 es actualmente el modelo de texto a voz más barato de la comparación en endpoints de API representativos, con Replicate a un precio de 0,65 US$ por 1 millón de caracteres. Ver proveedores de Kokoro 82M v1.0
Sonic 3.6 vía Cartesia, Qwen-Audio-3.0-TTS-Plus vía Alibaba Cloud y Realtime TTS-2 vía Inworld ofrecen actualmente algunas de las mejores compensaciones entre calidad y precio de la comparación. Estos endpoints representativos se ubican en la frontera actual de calidad frente a precio, lo que significa que pocas alternativas son a la vez más baratas y de mayor calidad. Ver proveedores de Sonic 3.6