Metodologia de benchmarking de geração de música
Escopo e contexto
A Artificial Analysis realiza benchmarks de modelos de geração de música, geralmente disponibilizados por meio de endpoints de API serverless. Esta página descreve a metodologia usada para medir a qualidade dos modelos por meio de votos de preferência humana na Music Arena da Artificial Analysis.
Para os recursos de geração de música, publicamos dois benchmarks:
- AA-Music-Instrumental v1.1: modelos que geram música sem vocais.
- AA-Music-Vocal v1.1: modelos que geram música com elementos vocais cantados ou falados.
Aplicamos um conjunto padrão de configurações a todas as faixas que geramos em todos os modelos e provedores, para que os resultados sejam o mais comparáveis possível. Essas configurações estão listadas abaixo, em Configurações padrão de geração.
Elo de qualidade
A pontuação Elo de cada modelo reflete sua qualidade relativa, com base nos votos cegos do nosso painel recrutado na Music Arena da Artificial Analysis. Calculamos as classificações usando estimativa de máxima verossimilhança de Bradley-Terry e as redimensionamos para uma faixa semelhante à do Elo, facilitando a leitura. Essa é a mesma metodologia usada em nossas Arenas de Imagem e Vídeo. Um intervalo de confiança de 95% é informado junto a cada classificação e fica mais estreito à medida que um modelo recebe mais votos.
Na arena, os usuários comparam apenas faixas da mesma modalidade. O Elo é informado separadamente para o AA-Music-Instrumental v1.1 e o AA-Music-Vocal v1.1, e também é detalhado por gênero.
Votação na arena
O Elo de qualidade é totalmente baseado em votos cegos e pareados de preferência do nosso painel recrutado. Em cada comparação, o participante do painel recebe duas faixas geradas com o mesmo prompt e na mesma modalidade, ouve as duas e seleciona a que prefere. Os votos públicos registrados na Music Arena não entram no cálculo das classificações.
- Requisito de reprodução: o usuário só pode votar depois de ouvir pelo menos 10 segundos de cada faixa, para que as preferências reflitam a saída de áudio como um todo, e não uma primeira impressão.
- Votação cega: os nomes e logotipos dos modelos, além de quaisquer detalhes que possam identificá-los, ficam ocultos até o registro do voto.
Normalização de áudio
Antes de entrarem na arena, todas as faixas são normalizadas para uma sonoridade e um formato de entrega uniformes, para que os votos reflitam a qualidade musical, e não diferenças de volume ou características dos arquivos.
- Sonoridade: cada faixa é ajustada para uma meta de sonoridade integrada de -16 LUFS (ITU-R BS.1770), com um único ajuste de ganho estático; os aumentos ficam limitados a um teto de pico verdadeiro de -1 dBTP para evitar clipping. Assim, faixas sem headroom suficiente ficam ligeiramente abaixo da meta. Não aplicamos compressão, limitação nem equalização, preservando a dinâmica e o equilíbrio tonal de cada faixa.
- Formato de entrega: todas as faixas são recodificadas para MP3 a 320 kbps e 44,1 kHz, sem os metadados do provedor nem a arte incorporada, independentemente do formato retornado pelo provedor. A configuração original de canais (mono ou estéreo) é preservada.
Rankings
Publicamos um ranking global para cada benchmark, AA-Music-Instrumental v1.1 e AA-Music-Vocal v1.1.
- Ranking global: reúne todos os votos elegíveis do nosso painel recrutado. Um modelo passa a aparecer depois de receber um número mínimo de votos.
O ranking global também pode ser filtrado por gênero.
Prompts e gêneros
Os prompts vêm de um conjunto selecionado e reproduzível, que abrange vários estilos musicais, complementado por prompts enviados por usuários (entre 25 e 200 caracteres), que analisamos antes de adicionar à rotação.
Cada prompt recebe a marcação de um gênero, como Pop, Hip-Hop / Rap, Eletrônica (EDM), Clássica / Orquestral e Jazz & Blues. Usando o mesmo método de Bradley-Terry, calculamos uma classificação Elo por gênero junto à classificação geral de cada modalidade e a exibimos assim que o gênero tem votos suficientes para produzir um resultado relevante.
Configurações padrão de geração
Estas configurações se aplicam tanto ao AA-Music-Instrumental v1.1 quanto ao AA-Music-Vocal v1.1, salvo indicação em contrário.
| Configuração | Valor |
|---|---|
| Faixas por prompt | 1 |
| Duração | Aproximadamente 3 minutos (ou a duração compatível mais próxima; quando um modelo produz uma saída com duração fixa, usamos essa duração) |
| Formato de áudio | MP3 quando configurável; caso contrário, o padrão do provedor |
| Taxa de amostragem | 44,1 kHz quando configurável; caso contrário, o padrão do provedor |
| Semente | 42, quando o provedor disponibiliza um parâmetro de semente |
| Letra | Gerada pelo modelo com base no prompt (AA-Music-Vocal v1.1); não se aplica a AA-Music-Instrumental v1.1 |
| Vocais | Desativados para AA-Music-Instrumental v1.1; ativados para AA-Music-Vocal v1.1 |
Os modelos de música variam muito quanto aos parâmetros que disponibilizam. Quando um provedor não oferece suporte a uma configuração padrão, usamos o valor compatível mais próximo ou o padrão do provedor. As configurações são mantidas constantes para cada modelo em todas as gerações usadas na Music Arena.
AA-Music-Instrumental v1.1
O AA-Music-Instrumental v1.1 abrange modelos que geram música sem vocais. Um modelo só é avaliado no AA-Music-Instrumental v1.1 se o endpoint conseguir produzir uma saída instrumental, por exemplo, por meio de uma opção instrumental ou de controles de estilo e de prompt negativo que suprimam os vocais. Se um endpoint não oferece uma forma de separar a geração instrumental da vocal, avaliamos o modelo apenas no AA-Music-Vocal v1.1.
AA-Music-Vocal v1.1
Um modelo só é avaliado no AA-Music-Vocal v1.1 se conseguir receber um prompt e gerar a letra e os vocais por conta própria. Não fornecemos letras, portanto o benchmark reflete a capacidade completa de cada modelo de compor uma música.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos populares e de alto desempenho para geração de música, ajudando os usuários a escolher entre eles. Por isso, aplicamos testes de relevância no setor e desempenho competitivo para avaliar a inclusão de novos modelos e provedores. Aprimoramos continuamente esses critérios e recebemos comentários e sugestões. Para sugerir modelos ou provedores, entre em contato pela página de contato.
Declaração de independência
O benchmarking é realizado com total independência e objetividade. Não recebemos remuneração de nenhum provedor por sua inclusão na Artificial Analysis nem por resultados favoráveis.