Metodologia de benchmarking de texto para fala
Escopo e contexto
A Artificial Analysis realiza benchmarks de modelos de texto para fala, principalmente os disponibilizados por meio de endpoints de API serverless. Esta página descreve nossa metodologia de benchmarking de texto para fala, incluindo benchmarks de qualidade e desempenho. As métricas de velocidade e preço exigem um endpoint serverless. Modelos sem um endpoint desse tipo ainda podem ser incluídos nas Arenas apenas para comparação de qualidade.
Tanto em nossos benchmarks de desempenho quanto nas Arenas, buscamos refletir a experiência dos usuários finais das APIs serverless. Usamos a implementação padrão das APIs dos provedores, conforme recomendado na documentação de cada um.
Principais métricas
Usamos as seguintes métricas para acompanhar a qualidade, o desempenho e o preço dos modelos de texto para fala.
Elo de qualidade
Pontuação Elo relativa dos modelos, determinada pelas respostas dos usuários na Artificial Analysis Text to Speech Arena. As classificações são calculadas a partir de votos par a par com um modelo Bradley-Terry ajustado por máxima verossimilhança. As pontuações são ancoradas fixando um modelo por arena em 1000, e as demais são informadas em relação a ele na escala Elo padrão. Veja Como a arena funciona mais abaixo para mais detalhes sobre como as comparações são apresentadas e votadas.
A amostragem dos confrontos favorece modelos que precisam de comparações, como os incorporados recentemente e os que ainda não têm pontuação, de modo que modelos novos acumulam comparações rapidamente. Um limite restringe a parcela das comparações de um modelo que pode caber a um mesmo adversário e, na estimação, os duelos de pares que se repetem com frequência recebem peso menor, de modo que nenhum confronto isolado domine a pontuação de um modelo. Em nossos experimentos, as classificações da Provider Voice Arena e da Controlled Voice Arena não se mostraram sensíveis à intensidade dessa ponderação.
Cada quadro é ajustado de forma independente: a pontuação geral usa todos os votos elegíveis, enquanto os quadros por categoria, sotaque e idioma são ajustes separados sobre os próprios subconjuntos, e não agregações do resultado geral. Todos os votos elegíveis no histórico de um quadro contam igualmente, sem ponderação temporal nem decaimento por antiguidade. As pontuações são recalculadas várias vezes ao dia a partir de todo o histórico de votos e revisadas antes da publicação. Exibimos intervalos de confiança de 95% e faixas de posição, e os modelos são ordenados pelo Elo sem arredondamento. Alguns modelos podem não aparecer por ainda não terem votos suficientes.
Pronunciation Robustness
O benchmark Pronunciation Robustness mede se os modelos de Text to Speech pronunciam corretamente textos difíceis. Ele complementa os resultados de preferência da Arena pontuando cada modelo na pronúncia de um conjunto fixo de frases de desafio, avaliadas por revisores humanos segundo leituras aceitas.
Cada modelo lê o conjunto idêntico com uma única voz fixa em inglês americano. Cada frase contém um ou mais trechos destacados com pronúncias aceitas, incluindo variantes válidas em inglês americano e britânico. Os clipes são apresentados aos revisores em ordem aleatória e sem nomes de modelos. Os prompts são enviados a cada modelo como escritos, sem normalização da nossa parte. Quando um modelo oferece uma opção de normalização de texto, usamos o seu valor padrão.
O conjunto cobre quatro categorias de desafios de pronúncia:
- Contextually Appropriate (Contextual Disambiguation): palavras com a mesma grafia mas leituras diferentes conforme o contexto, p. ex. a wound that is bandaged vs. a bandage that is wound.
- Expanding Shorthand (Text Normalization): números, datas, unidades e notação lidos com naturalidade, p. ex. 6'2", Chapter XVII ou 1 tsp of sugar.
- Preserving Exact Sequences (Sequence Fidelity): códigos, caminhos, e-mails e identificadores falados com exatidão, p. ex. .env.local ou a.chen@ucsf.edu.
- Standalone Terms (Term Pronunciation): nomes de marcas, lugares e termos técnicos pronunciados corretamente, p. ex. Arkansas, façade ou genre.
Três ou mais revisores independentes avaliam mais de 95% dos clipes de cada modelo publicado. Para cada trecho destacado, respondem com Sim, Não ou Não consegui distinguir se foi pronunciado de forma natural e correta. A pontuação de um modelo é a proporção de julgamentos respondidos Sim sobre Sim mais Não. Respostas "Não consegui distinguir" são excluídas do denominador. As pontuações por categoria usam a mesma fórmula sobre os trechos daquela categoria. As barras de erro mostram intervalos de confiança de 95%, calculados com erros padrão agrupados por trecho, pois cada trecho é avaliado por vários revisores.
Publicamos os resultados de um modelo quando pelo menos 95% das amostras do conjunto são cobertas por três ou mais revisores aprovados.
Veja a visão geral do Pronunciation Robustness para um exemplo do cartão de avaliação exibido aos revisores e clipes de exemplo de cada modelo do benchmark.
Preço por 1 milhão de caracteres
O preço de todos os modelos TTS é informado por 1 milhão de caracteres de texto de entrada. Quando os provedores não cobram diretamente por caractere, calculamos um valor equivalente:
- Por caractere: a tarifa informada é usada diretamente
- Planos de assinatura: tarifa efetiva do plano de menor custo, anual quando disponível, que inclua pelo menos 1 milhão de caracteres, considerando 80% de utilização
- Baseado em tokens: calculado com os preços em lote, convertendo caracteres em tokens de entrada e estimando a duração da saída de áudio
- Duração da saída: convertida considerando uma velocidade de fala de 150 palavras por minuto, aproximadamente 825 caracteres por minuto
- Por byte: 1 byte UTF-8 equivale a aproximadamente 1 caractere em textos em inglês
- Tempo de inferência: estimado com base em execuções do benchmark usando cerca de 25 textos com aproximadamente 500 caracteres
- Pesos abertos: listados sem preço, a menos que o modelo também seja oferecido por uma API paga, caso em que essa tarifa é usada
- Modelos de fala para fala: calculado com base no custo de gerar fala para 20 prompts fixos da arena TTS, considerando a entrada de texto, o áudio de saída, o texto de saída e os tokens de raciocínio/reflexão informados separadamente. Os tokens do texto de saída são incluídos quando informados como parte da resposta de áudio. Excluímos os efeitos do cache porque os prompts são executados de forma independente, como solicitações de um único turno, portanto o impacto no preço é irrelevante.
Throughput
Mediana de caracteres de texto de entrada que o provedor converte em fala por segundo, calculada sobre os últimos 3 dias de medições. Em cada geração, dividimos a contagem de caracteres do prompt pelo tempo necessário para gerar e receber o clipe.
A medição inclui o download do clipe de áudio do provedor quando é fornecida uma URL em vez de uma resposta de áudio. Assim refletimos como os usuários finais realmente recebem um clipe gerado, já que as URLs podem ser geradas antes de o áudio ser concluído. Os clipes de áudio são gerados com tamanho de lote 1 quando aplicável.
O benchmarking é realizado 4 vezes por dia. Em cada avaliação, selecionamos uma única voz aleatória para cada modelo. Um prompt exclusivo com aproximadamente 500 caracteres é usado em cada geração.
Como a arena funciona
Cada comparação apresenta dois clipes de áudio gerados a partir do mesmo prompt de texto. Na Provider Voice Arena, os dois clipes usam vozes da mesma categoria de gênero e sotaque; na Controlled Voice Arena, os dois usam a mesma voz de referência clonada. Os nomes dos modelos ficam ocultos até depois do voto, a ordem de apresentação é aleatória e quem ouve precisa reproduzir uma parte mínima de cada clipe antes que o voto seja liberado. O voto é uma escolha binária, sem opção de empate. Os prompts cobrem quatro categorias (atendimento ao cliente, entretenimento, compartilhamento de conhecimento e assistentes) e incluem material difícil, como sequências alfanuméricas e sequências numéricas; o conjunto de prompts é renovado ao longo do tempo.
As amostras de áudio são geradas uma única vez por modelo e padronizadas antes de entrar na arena, de modo que os votos de um modelo recaem sobre um conjunto consistente de amostras que pode ser conferido e normalizado antes de ir ao ar. Os clipes são convertidos para um formato de reprodução uniforme e normalizados para um mesmo alvo de loudness, para que diferenças de volume ou codificação entre provedores não influenciem os votos.
Controlled Voice Arena
A Controlled Voice Arena usa clonagem de voz para padronizar as vozes usadas na avaliação de cada modelo de texto para fala. Ao comparar os modelos com as mesmas vozes de referência, ela separa a preferência do ouvinte por uma determinada voz de aspectos mais amplos da qualidade do modelo, como naturalidade da fala, qualidade do áudio, pronúncia, ritmo e prosódia. Isso permite uma comparação mais equivalente entre os modelos de texto para fala subjacentes.
Para a Controlled Voice Arena, o conjunto de referência em inglês é composto por 8 vozes gravadas profissionalmente: 2 femininas dos EUA, 2 masculinas dos EUA, 2 femininas do Reino Unido e 2 masculinas do Reino Unido. Quando um modelo aceita a gravação de referência completa, inclusive modelos que a recortam nativamente, fornecemos a gravação completa. Quando um modelo limita a duração do áudio de referência, fornecemos uma versão mais curta, normalmente de 5 a 10 ou de 10 a 15 segundos, cortada em uma pausa natural.
Além do inglês, a Controlled Voice Arena também avalia modelos em espanhol, francês, alemão, português, japonês, híndi, chinês mandarim, árabe e vietnamita. Para cada idioma diferente do inglês, o conjunto de referência inclui uma voz masculina e uma voz feminina gravadas profissionalmente, ambas por falantes nativos. A clonagem de voz também é usada para padronizar as vozes dentro de cada idioma, enquanto os votos de preferência são coletados de avaliadores que passam por uma triagem para garantir que o idioma avaliado seja sua primeira língua. Cada modelo é avaliado apenas nos idiomas que suporta, e uma classificação específica por idioma é publicada quando os modelos acumulam comparações suficientes para produzir pontuações Elo estáveis.
A Controlled Voice Arena complementa nossa Provider Voice Arena, na qual cada modelo é avaliado com um conjunto representativo de suas próprias vozes disponíveis publicamente.
Selecione abaixo uma voz controlada para ouvir sua gravação de referência.
Provider Voice Arena
A Provider Voice Arena avalia cada modelo de texto para fala com um conjunto representativo das vozes disponibilizadas pelo provedor do modelo. Isso complementa a Controlled Voice Arena, na qual os modelos são comparados com as mesmas vozes de referência clonadas. As vozes dos provedores refletem a experiência típica dos usuários com cada modelo por meio de sua API pública, interface do produto ou documentação.
Para cada modelo, selecionamos várias vozes oferecidas pelo provedor para tornar a comparação representativa e justa. Selecionamos 2 vozes para cada combinação de masculino ou feminino com sotaque dos EUA ou do Reino Unido, totalizando 8 vozes. Quando uma combinação de gênero e sotaque não está disponível, ela é excluída da avaliação na Provider Voice Arena.
As vozes são selecionadas com base no destaque que recebem nas interfaces e na documentação dos provedores. Excluímos vozes que não sejam neutras, como aquelas com sotaques regionais muito estilizados. Os criadores dos modelos também podem solicitar o uso de vozes específicas quando há muitas opções disponíveis. Quando não são fornecidas vozes pelo provedor, como geralmente acontece com modelos de pesos abertos, usamos clipes de voz de atores profissionais como arquivos de origem para gerar a fala (veja amostras na Controlled Voice Arena acima).
Selecione abaixo um criador de modelos para ver as vozes dos provedores usadas atualmente em cada um de seus modelos.
Qualidade de quem vota
A maior parte das avaliações que publicamos vem de um painel remunerado com bom histórico em projetos semelhantes, abrangendo tanto os votos de preferência nas arenas quanto as revisões de Pronunciation Robustness. Para as arenas em inglês e para Pronunciation Robustness, selecionamos falantes nativos de inglês residentes nos Estados Unidos ou no Reino Unido. Para cada idioma que não o inglês na Controlled Voice Arena, a seleção é feita pela primeira língua e, sempre que possível, com avaliadores que residem em seu país de origem, de modo que quem avalia é falante nativo do idioma avaliado.
As sessões de Pronunciation Robustness incluem clipes de verificação de atenção com respostas conhecidas, e revisores que erram qualquer verificação respondida são excluídos por completo. Os votos das arenas passam por uma triagem de qualidade automatizada antes de entrar no ranking. Quem avalia de forma remunerada nunca vê os nomes dos modelos. Comparamos continuamente os rankings do grupo remunerado e do público como checagem de consistência.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos e provedores populares e de alto desempenho de texto para fala, ajudando os usuários finais a escolher quais usar. Por isso, aplicamos testes de 'relevância no setor' e desempenho competitivo para avaliar a inclusão de novos modelos e provedores. Estamos aprimorando esses critérios e recebemos comentários e sugestões. Para sugerir modelos ou provedores, entre em contato conosco pela página de contato. Quando um provedor lança publicamente uma atualização relevante de um modelo, nós o listamos como uma nova variante datada, geramos novamente todas as suas amostras de arena e o classificamos sem herdar votos. As variantes anteriores continuam listadas enquanto forem elegíveis.
Declaração de independência
O benchmarking é realizado com total independência e objetividade. Não recebemos remuneração de nenhum provedor por sua inclusão na Artificial Analysis nem por resultados favoráveis.