Mejores modelos de texto a voz (TTS) con voces de proveedores
Compara la calidad, la velocidad y el precio de modelos de generación de voz usando, cuando estén disponibles, las voces nativas propias de cada modelo.
Para más detalles, consulta nuestra página de metodología.
Calidad
Elo de calidad de la Arena de voces de proveedores
Precios
Precio
Rendimiento
Caracteres por segundo
Preguntas frecuentes
Sonic 3.6 tiene actualmente la mayor calidad en la comparación de modelos de texto a voz de Artificial Analysis, con un Elo de calidad de 1277. Ver Sonic 3.6
Polly Neural es actualmente el modelo de texto a voz más rápido de la comparación en endpoints de API representativos, con Amazon Bedrock entregando 1432,4 caracteres por segundo. Ver proveedores de Polly Neural
Kokoro 82M v1.0 es actualmente el modelo de texto a voz más barato de la comparación en endpoints de API representativos, con Replicate a un precio de 0,65 US$ por 1 millón de caracteres. Ver proveedores de Kokoro 82M v1.0
Sonic 3.6 vía Cartesia, Realtime TTS-2 vía Inworld y Simba 3.2 vía SpeechifyAI ofrecen actualmente algunas de las mejores compensaciones entre calidad y precio de la comparación. Estos endpoints representativos se ubican en la frontera actual de calidad frente a precio, lo que significa que pocas alternativas son a la vez más baratas y de mayor calidad. Ver proveedores de Sonic 3.6