Methodik für das Benchmarking der Musikgenerierung
Umfang und Hintergrund
Artificial Analysis führt Benchmarks für Modelle zur Musikgenerierung durch, die üblicherweise über serverlose API-Endpunkte angeboten werden. Diese Seite beschreibt die Methodik, mit der wir die Modellqualität anhand menschlicher Präferenzabstimmungen in der Music Arena von Artificial Analysis messen.
Bei der Musikgenerierung decken wir zwei Modalitäten ab:
- Instrumental: Modelle, die Musik ohne Gesang erzeugen.
- Vocals: Modelle, die Musik mit gesungenen oder gesprochenen Stimmelementen erzeugen.
Wir wenden auf jeden erzeugten Track über alle Modelle und Anbieter hinweg einheitliche Standardeinstellungen an, damit die Ausgaben möglichst gut vergleichbar sind. Diese Einstellungen sind unten unter „Standardeinstellungen für die Generierung“ aufgeführt.
Qualitäts-Elo
Der Elo-Wert jedes Modells bildet seine relative Qualität ab und wird aus Nutzerstimmen in der Music Arena von Artificial Analysis abgeleitet. Wir berechnen die Bewertungen mit einer Maximum-Likelihood-Schätzung nach Bradley-Terry und skalieren sie zur besseren Lesbarkeit auf einen Elo-ähnlichen Bereich um. Dieselbe Methodik verwenden wir für unsere Bild- und Video-Arenen. Zusammen mit jeder Bewertung geben wir ein 95-%-Konfidenzintervall an, das mit zunehmender Stimmenzahl für ein Modell enger wird.
In der Arena vergleichen Nutzer nur Tracks derselben Modalität. Das Elo wird für jede Modalität separat ausgewiesen und zusätzlich nach Genre aufgeschlüsselt.
Abstimmungen in der Arena
Das Qualitäts-Elo beruht ausschließlich auf blinden, paarweisen menschlichen Präferenzabstimmungen. Bei jedem Vergleich werden einem Nutzer zwei Tracks angezeigt, die aus demselben Prompt und in derselben Modalität erzeugt wurden. Er hört sich beide an und wählt den bevorzugten Track aus.
- Mindesthörzeit: Eine Stimme kann erst abgegeben werden, nachdem der Nutzer mindestens 10 Sekunden jedes Tracks angehört hat. So spiegeln Präferenzen die gesamte Audioausgabe und nicht nur einen ersten Eindruck wider.
- Blind: Modellnamen, Logos und alle identifizierenden Details bleiben bis zur Stimmabgabe verborgen.
Audionormalisierung
Bevor Tracks in die Arena aufgenommen werden, normalisieren wir jeden Track auf eine einheitliche Lautheit und ein einheitliches Bereitstellungsformat. So spiegeln die Stimmen die musikalische Qualität und nicht Unterschiede bei Lautstärke oder Dateieigenschaften wider.
- Lautheit: Jeder Track wird mit einer einmaligen statischen Verstärkungsanpassung an eine integrierte Ziellautheit von -16 LUFS (ITU-R BS.1770) angeglichen. Anhebungen werden auf einen True-Peak-Grenzwert von -1 dBTP begrenzt, um Clipping zu vermeiden. Tracks ohne ausreichenden Headroom liegen daher knapp unter dem Zielwert. Wir wenden keine Kompression, Begrenzung oder Klangregelung an, sodass Dynamik und Klangbalance jedes Tracks erhalten bleiben.
- Bereitstellungsformat: Jeder Track wird unabhängig vom Format des Anbieters als MP3 mit 320 kbit/s bei 44,1 kHz neu codiert. Dabei werden Metadaten des Anbieters und eingebettete Coverbilder entfernt. Die ursprüngliche Kanalanordnung (Mono oder Stereo) bleibt erhalten.
Bestenlisten
Wir veröffentlichen für jede Modalität eine globale und eine persönliche Bestenliste.
- Globale Bestenliste: Fasst alle gültigen Nutzerstimmen zusammen. Ein Modell erscheint, sobald es eine Mindestzahl an Stimmen erhalten hat.
- Persönliche Bestenliste: Eine Rangliste, die aus den eigenen Stimmen eines einzelnen Nutzers erstellt wird. Sie wird freigeschaltet, sobald der Nutzer eine Mindestzahl an Stimmen abgegeben hat. Bis genügend Stimmen für eine verlässliche Rangfolge vorliegen, wird ein Hinweis auf die geringe Aussagesicherheit angezeigt.
Beide Bestenlisten lassen sich zusätzlich nach Genre filtern.
Prompts und Genres
Die Prompts stammen aus einer kuratierten, reproduzierbaren Auswahl verschiedener Musikstile. Ergänzend verwenden wir von Nutzern eingereichte Prompts (zwischen 25 und 200 Zeichen), die wir vor der Aufnahme in die Rotation prüfen.
Jeder Prompt wird einem Genre zugeordnet, etwa Pop, Hip-Hop / Rap, Electronic (EDM), Classical / Orchestral oder Jazz & Blues. Mit derselben Bradley-Terry-Methode berechnen wir neben der Gesamtrangliste jeder Modalität eine Elo-Rangliste je Genre. Sie wird angezeigt, sobald für das Genre genügend Stimmen für eine aussagekräftige Bewertung vorliegen.
Standardeinstellungen für die Generierung
Sofern nicht anders angegeben, gelten diese Einstellungen für die Benchmarks der Modalitäten Instrumental und Vocals.
| Einstellung | Wert |
|---|---|
| Tracks pro Prompt | 1 |
| Dauer | Etwa 3 Minuten (oder die nächste unterstützte Länge; erzeugt ein Modell eine Ausgabe mit fester Länge, verwenden wir diese Länge) |
| Audioformat | MP3, sofern konfigurierbar, andernfalls der Standardwert des Anbieters |
| Abtastrate | 44,1 kHz, sofern konfigurierbar, andernfalls der Standardwert des Anbieters |
| Seed | 42, sofern der Anbieter einen Seed-Parameter bereitstellt |
| Liedtext | Vom Modell anhand des Prompts erzeugt (Vocals); nicht auf Instrumental anwendbar |
| Gesang | Für Instrumental deaktiviert; für Vocals aktiviert |
Musikmodelle unterscheiden sich stark darin, welche Parameter sie bereitstellen. Unterstützt ein Anbieter eine Standardeinstellung nicht, verwenden wir den nächsten unterstützten Wert oder den Standardwert des Anbieters. Für jedes Modell bleiben die Einstellungen über alle für die Music Arena erzeugten Tracks hinweg konstant.
Instrumental
Modelle der Modalität Instrumental erzeugen Musik ohne Gesang. Ein Modell wird nur dann in dieser Modalität evaluiert, wenn sein Endpunkt instrumentale Ausgaben erzeugen kann, beispielsweise über ein Instrumental-Flag oder über Stil- und Negativ-Prompt-Steuerungen, die Gesang unterdrücken. Bietet ein Endpunkt keine Möglichkeit, instrumentale und vokale Generierung zu trennen, evaluieren wir das Modell nur in der Modalität Vocals.
Vocals
Ein Modell wird nur dann in dieser Modalität evaluiert, wenn es anhand eines Prompts selbstständig Liedtext und Gesang erzeugen kann. Wir stellen keine Liedtexte bereit, sodass der Benchmark die umfassende Songwriting-Fähigkeit jedes Modells abbildet.
Aufnahmekriterien für Modelle und Anbieter
Unser Ziel ist es, beliebte und leistungsstarke Modelle zur Musikgenerierung zu analysieren und zu vergleichen, damit Nutzer eine fundierte Auswahl treffen können. Daher prüfen wir die Branchenrelevanz und Wettbewerbsfähigkeit neuer Modelle und Anbieter, bevor wir sie aufnehmen. Wir entwickeln diese Kriterien laufend weiter und freuen uns über Feedback oder Vorschläge. Modelle oder Anbieter können über die Kontaktseite vorgeschlagen werden.
Unabhängigkeitserklärung
Das Benchmarking erfolgt unter strikter Wahrung von Unabhängigkeit und Objektivität. Artificial Analysis erhält von keinem Anbieter eine Vergütung für die Aufnahme in die Liste oder für positive Ergebnisse.