Melhores modelos de texto para fala (TTS) com vozes de provedores

Compare a qualidade, a velocidade e o preço de modelos de geração de fala usando, quando disponíveis, as vozes nativas de cada modelo.

Para mais detalhes, consulte nossa página de metodologia.

Qualidade

Elo de qualidade da Provider Voice Arena

Arena Elo: average Elo rating of the model · Higher is better

Relative Elo score of the models as determined by responses from users in Artificial Analysis' Speech Arena. Some models may not be shown due to not yet having enough votes.

Preços

Preço

Price: USD per 1M characters of text · Lower is better

Price per 1M characters of text. For detail on how we calculate price for providers which price based on inference time or subscription plans, see our methodology page.

Fator de velocidade

Caracteres por segundo

Characters processed per second: # of characters per second of generation time · Higher is better

Number of characters processed per second of generation time. Higher values indicate faster generation speeds.

Perguntas frequentes

Sonic 3.6 tem atualmente a maior qualidade na comparação de modelos de texto para fala da Artificial Analysis, com um Elo de qualidade de 1282. Ver Sonic 3.6

Polly Standard é atualmente o modelo de texto para fala mais rápido na comparação em endpoints de API representativos, com Amazon Bedrock entregando 1.364,3 caracteres por segundo. Ver provedores de Polly Standard

Kokoro 82M v1.0 é atualmente o modelo de texto para fala mais barato na comparação em endpoints de API representativos, com preço de US$ 0,65 por 1 milhão de caracteres via Replicate. Ver provedores de Kokoro 82M v1.0

Sonic 3.6 via Cartesia, Realtime TTS-2 via Inworld e Simba 3.2 via SpeechifyAI oferecem atualmente alguns dos melhores equilíbrios entre qualidade e preço na comparação. Esses endpoints representativos estão na fronteira atual de qualidade versus preço, o que significa que poucas alternativas são ao mesmo tempo mais baratas e de maior qualidade. Ver provedores de Sonic 3.6