Metodologia de benchmarking de geração de música
Escopo e contexto
A Artificial Analysis realiza benchmarks de modelos de geração de música, geralmente disponibilizados por meio de endpoints de API serverless. Esta página descreve a metodologia usada para medir a qualidade dos modelos por meio de votos de preferência humana na Music Arena da Artificial Analysis.
Para os recursos de geração de música, abrangemos duas modalidades:
- Instrumental: modelos que geram música sem vocais.
- Vocals: modelos que geram música com elementos vocais cantados ou falados.
Aplicamos um conjunto padrão de configurações a todas as faixas que geramos em todos os modelos e provedores, para que os resultados sejam o mais comparáveis possível. Essas configurações estão listadas abaixo, em Configurações padrão de geração.
Elo de qualidade
A pontuação Elo de cada modelo reflete sua qualidade relativa, com base nos votos dos usuários na Music Arena da Artificial Analysis. Calculamos as classificações usando estimativa de máxima verossimilhança de Bradley-Terry e as redimensionamos para uma faixa semelhante à do Elo, facilitando a leitura. Essa é a mesma metodologia usada em nossas Arenas de Imagem e Vídeo. Um intervalo de confiança de 95% é informado junto a cada classificação e fica mais estreito à medida que um modelo recebe mais votos.
Na arena, os usuários comparam apenas faixas da mesma modalidade. O Elo é informado separadamente para cada modalidade e também é detalhado por gênero.
Votação na arena
O Elo de qualidade é totalmente baseado em votos cegos e pareados de preferência humana. Em cada comparação, o usuário recebe duas faixas geradas com o mesmo prompt e na mesma modalidade, ouve as duas e seleciona a que prefere.
- Requisito de reprodução: o usuário só pode votar depois de ouvir pelo menos 10 segundos de cada faixa, para que as preferências reflitam a saída de áudio como um todo, e não uma primeira impressão.
- Votação cega: os nomes e logotipos dos modelos, além de quaisquer detalhes que possam identificá-los, ficam ocultos até o registro do voto.
Normalização de áudio
Antes de entrarem na arena, todas as faixas são normalizadas para uma sonoridade e um formato de entrega uniformes, para que os votos reflitam a qualidade musical, e não diferenças de volume ou características dos arquivos.
- Sonoridade: cada faixa é ajustada para uma meta de sonoridade integrada de -16 LUFS (ITU-R BS.1770), com um único ajuste de ganho estático; os aumentos ficam limitados a um teto de pico verdadeiro de -1 dBTP para evitar clipping. Assim, faixas sem headroom suficiente ficam ligeiramente abaixo da meta. Não aplicamos compressão, limitação nem equalização, preservando a dinâmica e o equilíbrio tonal de cada faixa.
- Formato de entrega: todas as faixas são recodificadas para MP3 a 320 kbps e 44,1 kHz, sem os metadados do provedor nem a arte incorporada, independentemente do formato retornado pelo provedor. A configuração original de canais (mono ou estéreo) é preservada.
Rankings
Publicamos um ranking global e um ranking pessoal para cada modalidade.
- Ranking global: reúne todos os votos elegíveis dos usuários. Um modelo passa a aparecer depois de receber um número mínimo de votos.
- Ranking pessoal: uma classificação criada com base nos votos de um único usuário. Ela é liberada quando o usuário registra um número mínimo de votos e exibe um aviso de baixa confiança até que haja votos suficientes para uma classificação confiável.
Os dois rankings também podem ser filtrados por gênero.
Prompts e gêneros
Os prompts vêm de um conjunto selecionado e reproduzível, que abrange vários estilos musicais, complementado por prompts enviados por usuários (entre 25 e 200 caracteres), que analisamos antes de adicionar à rotação.
Cada prompt recebe a marcação de um gênero, como Pop, Hip-Hop / Rap, Eletrônica (EDM), Clássica / Orquestral e Jazz & Blues. Usando o mesmo método de Bradley-Terry, calculamos uma classificação Elo por gênero junto à classificação geral de cada modalidade e a exibimos assim que o gênero tem votos suficientes para produzir um resultado relevante.
Configurações padrão de geração
Estas configurações se aplicam aos benchmarks de Instrumental e Vocals, salvo indicação em contrário.
| Configuração | Valor |
|---|---|
| Faixas por prompt | 1 |
| Duração | Aproximadamente 3 minutos (ou a duração compatível mais próxima; quando um modelo produz uma saída com duração fixa, usamos essa duração) |
| Formato de áudio | MP3 quando configurável; caso contrário, o padrão do provedor |
| Taxa de amostragem | 44,1 kHz quando configurável; caso contrário, o padrão do provedor |
| Semente | 42, quando o provedor disponibiliza um parâmetro de semente |
| Letra | Gerada pelo modelo com base no prompt (Vocals); não se aplica a Instrumental |
| Vocais | Desativados para Instrumental; ativados para Vocals |
Os modelos de música variam muito quanto aos parâmetros que disponibilizam. Quando um provedor não oferece suporte a uma configuração padrão, usamos o valor compatível mais próximo ou o padrão do provedor. As configurações são mantidas constantes para cada modelo em todas as gerações usadas na Music Arena.
Instrumental
Modelos Instrumental geram música sem vocais. Um modelo só é avaliado na modalidade Instrumental se o endpoint conseguir produzir uma saída instrumental, por exemplo, por meio de uma opção instrumental ou de controles de estilo e de prompt negativo que suprimam os vocais. Se um endpoint não oferece uma forma de separar a geração instrumental da vocal, avaliamos o modelo apenas na modalidade Vocals.
Vocals
Um modelo só é avaliado nesta modalidade se conseguir receber um prompt e gerar a letra e os vocais por conta própria. Não fornecemos letras, portanto o benchmark reflete a capacidade completa de cada modelo de compor uma música.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos populares e de alto desempenho para geração de música, ajudando os usuários a escolher entre eles. Por isso, aplicamos testes de relevância no setor e desempenho competitivo para avaliar a inclusão de novos modelos e provedores. Aprimoramos continuamente esses critérios e recebemos comentários e sugestões. Para sugerir modelos ou provedores, entre em contato pela página de contato.
Declaração de independência
O benchmarking é realizado com total independência e objetividade. Não recebemos remuneração de nenhum provedor por sua inclusão na Artificial Analysis nem por resultados favoráveis.