Metodologia de benchmarking de texto para fala
Escopo e contexto
A Artificial Analysis realiza benchmarks de modelos de texto para fala disponibilizados por meio de endpoints de API serverless. Esta página descreve nossa metodologia de benchmarking de texto para fala, incluindo benchmarks de qualidade e desempenho. Consideramos que os endpoints de texto para fala são serverless quando os clientes pagam apenas pelo uso, e não uma tarifa fixa de acesso.
Tanto em nossos benchmarks de desempenho quanto na Artificial Analysis Text to Speech Arena, buscamos refletir a experiência dos usuários finais de APIs serverless. Nosso foco é medir o tempo necessário para receber o arquivo de áudio localmente. Quando a resposta da API é uma URL, e não bytes, incluímos o tempo de download do arquivo em nossa medição do tempo de resposta. Nossa abordagem é usar a implementação padrão das APIs dos provedores, conforme recomendado na documentação de cada um. Quando a API do provedor oferece essa opção, padronizamos a taxa de amostragem do áudio em 22,05 kHz.
Principais métricas
Usamos as seguintes métricas para acompanhar a qualidade, o desempenho e o preço dos modelos de texto para fala.
Elo de qualidade
Pontuação Elo relativa dos modelos, determinada pelas respostas dos usuários na Artificial Analysis Text to Speech Arena.
Alguns modelos podem não aparecer por ainda não terem votos suficientes. Usamos um modelo de regressão linear semelhante ao método usado pela LMSYS para calcular as pontuações Elo da Chatbot Arena.
Preço por 1 milhão de caracteres
O preço de todos os modelos TTS é informado por 1 milhão de caracteres de texto de entrada. Quando os provedores não cobram diretamente por caractere, calculamos um valor equivalente:
- Por caractere: a tarifa informada é usada diretamente
- Planos de assinatura: tarifa efetiva do plano de menor custo, anual quando disponível, que inclua pelo menos 1 milhão de caracteres, considerando 80% de utilização
- Baseado em tokens: calculado com os preços em lote, convertendo caracteres em tokens de entrada e estimando a duração da saída de áudio
- Duração da saída: convertida considerando uma velocidade de fala de 150 palavras por minuto, aproximadamente 825 caracteres por minuto
- Por byte: 1 byte UTF-8 equivale a aproximadamente 1 caractere em textos em inglês
- Tempo de inferência: estimado com base em execuções do benchmark usando cerca de 25 textos com aproximadamente 500 caracteres
- Pesos abertos: sem preço de API comercial; listado sem preço
- Modelos de fala para fala: calculado com base no custo de gerar fala para 20 prompts fixos da arena TTS, considerando a entrada de texto, o áudio de saída, o texto de saída e os tokens de raciocínio/reflexão informados separadamente. Os tokens do texto de saída são incluídos quando informados como parte da resposta de áudio. Excluímos os efeitos do cache porque os prompts são executados de forma independente, como solicitações de um único turno, portanto o impacto no preço é irrelevante.
Não incluímos descontos temporários ao informar os preços.
Tempo de geração
Mediana do tempo que o provedor leva para gerar um único clipe de áudio com aproximadamente 500 caracteres de entrada, calculada com base nos últimos 14 dias de medições.
O tempo de geração inclui o download do clipe de áudio do provedor quando é fornecida uma URL em vez de uma resposta de áudio. Isso reflete a latência vivenciada pelo usuário final para receber um clipe de áudio gerado, já que as URLs podem ser geradas antes da conclusão do áudio. Quando pertinente, os clipes de áudio são gerados com tamanho de lote 1.
O benchmarking é realizado 4 vezes por dia, em horários aleatórios. Em cada avaliação, selecionamos uma única voz aleatória para cada modelo. Um prompt exclusivo com aproximadamente 500 caracteres é usado em cada geração.
Vozes controladas
A Controlled Voice Arena usa clonagem de voz para padronizar as vozes usadas na avaliação de cada modelo de texto para fala. Ao comparar os modelos com as mesmas vozes de referência, ela separa a preferência do ouvinte por uma determinada voz de aspectos mais amplos da qualidade do modelo, como naturalidade da fala, qualidade do áudio, pronúncia, ritmo e prosódia. Isso permite uma comparação mais equivalente entre os modelos de texto para fala subjacentes.
A Controlled Voice Arena complementa nossa Provider Voice Arena, na qual cada modelo é avaliado com um conjunto representativo de suas próprias vozes disponíveis publicamente. O conjunto de referência é composto por 8 vozes gravadas profissionalmente: 2 femininas dos EUA, 2 masculinas dos EUA, 2 femininas do Reino Unido e 2 masculinas do Reino Unido. Selecione abaixo uma voz controlada para ouvir sua gravação de referência.
Vozes dos provedores
A Provider Voice Arena avalia cada modelo de texto para fala com um conjunto representativo das vozes disponibilizadas pelo provedor do modelo. Isso complementa a Controlled Voice Arena, na qual os modelos são comparados com as mesmas vozes de referência clonadas. As vozes dos provedores refletem a experiência típica dos usuários com cada modelo por meio de sua API pública, interface do produto ou documentação.
Para cada modelo, selecionamos várias vozes oferecidas pelo provedor para tornar a comparação representativa e justa. Selecionamos 2 vozes para cada combinação de masculino ou feminino com sotaque dos EUA ou do Reino Unido, totalizando 8 vozes. Quando uma combinação de gênero e sotaque não está disponível, ela é excluída da avaliação na Provider Voice Arena.
As vozes são selecionadas com base no destaque que recebem nas interfaces e na documentação dos provedores. Excluímos vozes que não sejam neutras, como aquelas com sotaques regionais muito estilizados. Os criadores dos modelos também podem solicitar o uso de vozes específicas quando há muitas opções disponíveis. Quando não são fornecidas vozes pelo provedor, como geralmente acontece com modelos de pesos abertos, usamos clipes de voz de atores profissionais como arquivos de origem para gerar a fala (veja amostras em Vozes controladas acima).
Selecione abaixo um criador de modelos para ver as vozes dos provedores usadas atualmente em cada um de seus modelos.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos e provedores populares e de alto desempenho de texto para fala, ajudando os usuários finais a escolher quais usar. Por isso, aplicamos testes de 'relevância no setor' e desempenho competitivo para avaliar a inclusão de novos modelos e provedores. Estamos aprimorando esses critérios e recebemos comentários e sugestões. Para sugerir modelos ou provedores, entre em contato conosco pela página de contato.
O benchmarking é realizado 4 vezes por dia, em horários aleatórios. Em cada avaliação, selecionamos uma única voz aleatória para cada modelo. Um prompt exclusivo com aproximadamente 500 caracteres é usado em cada geração.
Declaração de independência
O benchmarking é realizado com total independência e objetividade. Não recebemos remuneração de nenhum provedor por sua inclusão na Artificial Analysis nem por resultados favoráveis.