Methodik für das Benchmarking der Musikgenerierung
Umfang und Hintergrund
Artificial Analysis führt Benchmarks für Modelle zur Musikgenerierung durch, die üblicherweise über serverlose API-Endpunkte angeboten werden. Diese Seite beschreibt die Methodik, mit der wir die Modellqualität anhand menschlicher Präferenzabstimmungen in der Music Arena von Artificial Analysis messen.
Für die Musikgenerierung veröffentlichen wir zwei Benchmarks:
- AA-Music-Instrumental v1.1: Modelle, die Musik ohne Gesang erzeugen.
- AA-Music-Vocal v1.1: Modelle, die Musik mit gesungenen oder gesprochenen Stimmelementen erzeugen.
Wir wenden auf jeden erzeugten Track über alle Modelle und Anbieter hinweg einheitliche Standardeinstellungen an, damit die Ausgaben möglichst gut vergleichbar sind. Diese Einstellungen sind unten unter „Standardeinstellungen für die Generierung“ aufgeführt.
Qualitäts-Elo
Der Elo-Wert jedes Modells bildet seine relative Qualität ab und wird aus blinden Stimmen unseres rekrutierten Panels in der Music Arena von Artificial Analysis abgeleitet. Wir berechnen die Bewertungen mit einer Maximum-Likelihood-Schätzung nach Bradley-Terry und skalieren sie zur besseren Lesbarkeit auf einen Elo-ähnlichen Bereich um. Dieselbe Methodik verwenden wir für unsere Bild- und Video-Arenen. Zusammen mit jeder Bewertung geben wir ein 95-%-Konfidenzintervall an, das mit zunehmender Stimmenzahl für ein Modell enger wird.
In der Arena vergleichen Nutzer nur Tracks derselben Modalität. Das Elo wird für AA-Music-Instrumental v1.1 und AA-Music-Vocal v1.1 separat ausgewiesen und zusätzlich nach Genre aufgeschlüsselt.
Abstimmungen in der Arena
Das Qualitäts-Elo beruht ausschließlich auf blinden, paarweisen Präferenzabstimmungen unseres rekrutierten Panels. Bei jedem Vergleich werden einer teilnehmenden Person zwei Tracks angezeigt, die aus demselben Prompt und in derselben Modalität erzeugt wurden. Sie hört sich beide an und wählt den bevorzugten Track aus. Öffentliche Stimmen aus der Music Arena gehen nicht in die Rating-Berechnung ein.
- Mindesthörzeit: Eine Stimme kann erst abgegeben werden, nachdem der Nutzer mindestens 10 Sekunden jedes Tracks angehört hat. So spiegeln Präferenzen die gesamte Audioausgabe und nicht nur einen ersten Eindruck wider.
- Blind: Modellnamen, Logos und alle identifizierenden Details bleiben bis zur Stimmabgabe verborgen.
Audionormalisierung
Bevor Tracks in die Arena aufgenommen werden, normalisieren wir jeden Track auf eine einheitliche Lautheit und ein einheitliches Bereitstellungsformat. So spiegeln die Stimmen die musikalische Qualität und nicht Unterschiede bei Lautstärke oder Dateieigenschaften wider.
- Lautheit: Jeder Track wird mit einer einmaligen statischen Verstärkungsanpassung an eine integrierte Ziellautheit von -16 LUFS (ITU-R BS.1770) angeglichen. Anhebungen werden auf einen True-Peak-Grenzwert von -1 dBTP begrenzt, um Clipping zu vermeiden. Tracks ohne ausreichenden Headroom liegen daher knapp unter dem Zielwert. Wir wenden keine Kompression, Begrenzung oder Klangregelung an, sodass Dynamik und Klangbalance jedes Tracks erhalten bleiben.
- Bereitstellungsformat: Jeder Track wird unabhängig vom Format des Anbieters als MP3 mit 320 kbit/s bei 44,1 kHz neu codiert. Dabei werden Metadaten des Anbieters und eingebettete Coverbilder entfernt. Die ursprüngliche Kanalanordnung (Mono oder Stereo) bleibt erhalten.
Bestenlisten
Wir veröffentlichen für jeden Benchmark, AA-Music-Instrumental v1.1 und AA-Music-Vocal v1.1, eine globale Bestenliste.
- Globale Bestenliste: Fasst alle gültigen Stimmen unseres rekrutierten Panels zusammen. Ein Modell erscheint, sobald es eine Mindestzahl an Stimmen erhalten hat.
Die globale Bestenliste lässt sich zusätzlich nach Genre filtern.
Prompts und Genres
Die Prompts stammen aus einer kuratierten, reproduzierbaren Auswahl verschiedener Musikstile. Ergänzend verwenden wir von Nutzern eingereichte Prompts (zwischen 25 und 200 Zeichen), die wir vor der Aufnahme in die Rotation prüfen.
Jeder Prompt wird einem Genre zugeordnet, etwa Pop, Hip-Hop / Rap, Electronic (EDM), Classical / Orchestral oder Jazz & Blues. Mit derselben Bradley-Terry-Methode berechnen wir neben der Gesamtrangliste jeder Modalität eine Elo-Rangliste je Genre. Sie wird angezeigt, sobald für das Genre genügend Stimmen für eine aussagekräftige Bewertung vorliegen.
Standardeinstellungen für die Generierung
Sofern nicht anders angegeben, gelten diese Einstellungen sowohl für AA-Music-Instrumental v1.1 als auch für AA-Music-Vocal v1.1.
| Einstellung | Wert |
|---|---|
| Tracks pro Prompt | 1 |
| Dauer | Etwa 3 Minuten (oder die nächste unterstützte Länge; erzeugt ein Modell eine Ausgabe mit fester Länge, verwenden wir diese Länge) |
| Audioformat | MP3, sofern konfigurierbar, andernfalls der Standardwert des Anbieters |
| Abtastrate | 44,1 kHz, sofern konfigurierbar, andernfalls der Standardwert des Anbieters |
| Seed | 42, sofern der Anbieter einen Seed-Parameter bereitstellt |
| Liedtext | Vom Modell anhand des Prompts erzeugt (AA-Music-Vocal v1.1); nicht auf AA-Music-Instrumental v1.1 anwendbar |
| Gesang | Für AA-Music-Instrumental v1.1 deaktiviert; für AA-Music-Vocal v1.1 aktiviert |
Musikmodelle unterscheiden sich stark darin, welche Parameter sie bereitstellen. Unterstützt ein Anbieter eine Standardeinstellung nicht, verwenden wir den nächsten unterstützten Wert oder den Standardwert des Anbieters. Für jedes Modell bleiben die Einstellungen über alle für die Music Arena erzeugten Tracks hinweg konstant.
AA-Music-Instrumental v1.1
AA-Music-Instrumental v1.1 umfasst Modelle, die Musik ohne Gesang erzeugen. Ein Modell wird nur dann auf AA-Music-Instrumental v1.1 evaluiert, wenn sein Endpunkt instrumentale Ausgaben erzeugen kann, beispielsweise über ein Instrumental-Flag oder über Stil- und Negativ-Prompt-Steuerungen, die Gesang unterdrücken. Bietet ein Endpunkt keine Möglichkeit, instrumentale und vokale Generierung zu trennen, evaluieren wir das Modell nur auf AA-Music-Vocal v1.1.
AA-Music-Vocal v1.1
Ein Modell wird nur dann auf AA-Music-Vocal v1.1 evaluiert, wenn es anhand eines Prompts selbstständig Liedtext und Gesang erzeugen kann. Wir stellen keine Liedtexte bereit, sodass der Benchmark die umfassende Songwriting-Fähigkeit jedes Modells abbildet.
Aufnahmekriterien für Modelle und Anbieter
Unser Ziel ist es, beliebte und leistungsstarke Modelle zur Musikgenerierung zu analysieren und zu vergleichen, damit Nutzer eine fundierte Auswahl treffen können. Daher prüfen wir die Branchenrelevanz und Wettbewerbsfähigkeit neuer Modelle und Anbieter, bevor wir sie aufnehmen. Wir entwickeln diese Kriterien laufend weiter und freuen uns über Feedback oder Vorschläge. Modelle oder Anbieter können über die Kontaktseite vorgeschlagen werden.
Unabhängigkeitserklärung
Das Benchmarking erfolgt unter strikter Wahrung von Unabhängigkeit und Objektivität. Artificial Analysis erhält von keinem Anbieter eine Vergütung für die Aufnahme in die Liste oder für positive Ergebnisse.