Metodología de benchmarking de generación de música

Alcance y contexto

Artificial Analysis realiza benchmarking de modelos de generación de música que normalmente se entregan mediante endpoints de API serverless. Esta página describe la metodología usada para medir la calidad de los modelos mediante votación de preferencia humana en la Arena de música de Artificial Analysis.

Para capacidades de generación de música, cubrimos dos modalidades:

  • Instrumental: modelos que generan música sin voces.
  • Vocals: modelos que generan música con elementos vocales cantados o hablados.

Aplicamos un conjunto estándar de configuraciones predeterminadas a cada pista que generamos en todos los modelos y proveedores, para que las salidas sean lo más comparables posible. Estas se listan en Configuración predeterminada de generación más abajo.

Elo de calidad

El puntaje Elo de cada modelo refleja su calidad relativa, derivada de votos de usuarios en la Arena de música de Artificial Analysis. Calculamos las calificaciones usando estimación de máxima verosimilitud Bradley-Terry y las reescalamos a un rango similar a Elo para facilitar la lectura. Esta es la misma metodología que se usa para nuestras Arenas de imagen y video. Se reporta un intervalo de confianza del 95% junto a cada calificación, que se estrecha a medida que un modelo recibe más votos.

En la Arena, los usuarios solo comparan pistas dentro de la misma modalidad. El Elo se reporta por separado para cada modalidad y se desglosa además por género.

Votación en la Arena

El Elo de calidad proviene completamente de votos de preferencia humana, ciegos y por pares. En cada comparación, el usuario ve dos pistas generadas a partir del mismo prompt y en la misma modalidad, escucha ambas y selecciona la que prefiere.

  • Requisito de escucha: solo se puede emitir un voto después de que el usuario haya escuchado al menos 10 segundos de cada pista, para que las preferencias reflejen la salida de audio completa y no una primera impresión.
  • Ciego: los nombres de modelos, logos y cualquier detalle identificador se ocultan hasta que se emite el voto.

Normalización de audio

Antes de que las pistas entren a la Arena, normalizamos cada pista a una sonoridad y un formato de entrega uniformes, para que los votos reflejen la calidad musical y no diferencias de volumen o de características del archivo.

  • Sonoridad: cada pista se ajusta hacia un objetivo de sonoridad integrada de -16 LUFS (ITU-R BS.1770) mediante un único ajuste de ganancia estática; los aumentos se limitan a un techo de pico real de -1 dBTP para evitar el clipping, por lo que las pistas sin suficiente margen quedan ligeramente por debajo del objetivo. No aplicamos compresión, limitación ni ecualización, por lo que se preservan la dinámica y el balance tonal de cada pista.
  • Formato de entrega: cada pista se recodifica a MP3 de 320 kbps a 44.1 kHz, eliminando los metadatos del proveedor y la carátula incrustada, independientemente del formato devuelto por el proveedor. Se preserva la disposición de canales original (mono o estéreo).

Rankings

Publicamos un ranking global y un ranking personal para cada modalidad.

  • Ranking global: agrega todos los votos elegibles de los usuarios. Un modelo aparece cuando ha recibido una cantidad mínima de votos.
  • Ranking personal: un ranking construido a partir de los votos propios de un solo usuario. Se desbloquea cuando el usuario ha emitido una cantidad mínima de votos y muestra una advertencia de baja confianza hasta que haya votado lo suficiente para una clasificación confiable.

Ambos rankings también pueden filtrarse por género.

Prompts y géneros

Los prompts se extraen de un conjunto curado y reproducible que cubre una variedad de estilos musicales, complementado con prompts enviados por usuarios (entre 25 y 200 caracteres) que revisamos antes de agregarlos a la rotación.

Cada prompt se etiqueta con un género, como Pop, Hip-Hop / Rap, Electrónica (EDM), Clásica / Orquestal y Jazz & Blues. Usando el mismo método Bradley-Terry, calculamos un ranking Elo por género junto con el ranking general de cada modalidad y lo mostramos cuando el género tiene suficientes votos para ser significativo.

Configuración predeterminada de generación

Estas configuraciones se aplican a los benchmarks de Instrumental y Vocals, salvo que se especifique lo contrario.

ConfiguraciónValor
Pistas por prompt1
DuraciónAproximadamente 3 minutos (o la duración soportada más cercana; cuando un modelo produce una salida de duración fija, usamos esa duración)
Formato de audioMP3 cuando es configurable; de lo contrario, el valor predeterminado del proveedor
Frecuencia de muestreo44.1 kHz cuando es configurable; de lo contrario, el valor predeterminado del proveedor
Semilla42, cuando el proveedor expone un parámetro de semilla
LetraGenerada por el modelo a partir del prompt (Vocals); no aplica para Instrumental
VocesDesactivadas para Instrumental; activadas para Vocals

Los modelos de música difieren mucho en los parámetros que exponen. Cuando un proveedor no soporta un valor predeterminado, usamos el valor soportado más cercano o el valor predeterminado del proveedor. Las configuraciones se mantienen constantes para cada modelo en todas las generaciones usadas en la Arena de música.

Instrumental

Los modelos de la modalidad Instrumental generan música sin voces. Un modelo se evalúa en la modalidad Instrumental solo si su endpoint puede producir salida instrumental, por ejemplo mediante un parámetro instrumental o controles de estilo y prompts negativos que suprimen voces. Si un endpoint no ofrece forma de separar generación instrumental y vocal, evaluamos el modelo solo en la modalidad Vocals.

Vocals

Un modelo se evalúa en esta modalidad solo si puede tomar un prompt y generar la letra y las voces por sí mismo. No proporcionamos letras, por lo que el benchmark refleja la capacidad end-to-end de composición de canciones de cada modelo.

Criterios de inclusión de modelos y proveedores

Nuestro objetivo es analizar y comparar modelos de generación de música populares y de alto rendimiento para ayudar a los usuarios a elegir entre ellos. Por eso aplicamos pruebas de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Refinamos estos criterios continuamente y aceptamos con gusto comentarios o sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto.

Declaración de independencia

El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.