Methodik für Videogenerierungs-Benchmarks

Umfang und Hintergrund

Artificial Analysis führt Benchmarks für Videogenerierungsmodelle durch, die in der Regel über serverlose API-Endpunkte bereitgestellt werden. Diese Seite beschreibt die Methodik zur Messung von Qualität, Geschwindigkeit und Preis dieser Modelle.

Bei der Videogenerierung decken wir sechs Modalitäten ab:

  • Text zu Video: Modelle, die Videos ausschließlich aus einem Text-Prompt generieren.
  • Bild zu Video: Modelle, die ein Referenzbild als ersten Frame und, sofern unterstützt, einen begleitenden Text-Prompt zur Videogenerierung verwenden.
  • Videobearbeitung: Modelle, die aus einer Videoeingabe und einem Text-Prompt ein Video generieren.
  • Text zu Video mit Audio: Text-zu-Video-Modelle, die zusammen mit dem Video synchronisiertes Audio generieren.
  • Bild zu Video mit Audio: Bild-zu-Video-Modelle, die zusammen mit dem Video synchronisiertes Audio generieren.
  • Videobearbeitung mit Audio: Videobearbeitungsmodelle, die zusammen mit dem Video synchronisiertes Audio generieren.

Jede Modalität hat in der Video Arena ihren eigenen Elo-Pool. Ausgaben ohne und mit Audio werden daher nicht direkt miteinander verglichen, ebenso wenig Bearbeitung und Generierung.

Wir verwenden für jedes Video, das wir mit den verschiedenen Modellen und Anbietern generieren, ein einheitliches Set an Standardeinstellungen. Um die Vergleichbarkeit sicherzustellen, werden die Videos jedes Modells mit identischen Einstellungen für Auflösung, Bildrate, Dauer, Seitenverhältnis, Seed, Guidance und Inferenzschritte erzeugt. Alle Standardeinstellungen finden Sie weiter unten unter „Standardeinstellungen für die Generierung“.

Abgedeckte Endpunkte

Abgedeckte Workloads: Die Inferenz-Benchmarks umfassen Endpunkte zur Text-zu-Video- und Bild-zu-Video-Generierung.

Nur öffentliche serverlose Endpunkte: Die Benchmarks umfassen echte serverlose Endpunkte, die öffentlich verfügbar sind oder werden. Demoprodukte, Hardwarevorführungen und dedizierte oder private Bereitstellungen sind nicht Gegenstand der Benchmarks.

Standard- und modifizierte Endpunkte

Wir stufen jeden Endpunkt entweder als Standard ein – er stellt das native Modell mit voller Wiedergabetreue bereit und macht dessen übliche Eingabeparameter zugänglich – oder als Modifiziert – das native Modell wurde auf eine Weise verändert, die sich auf die Wiedergabetreue der Ausgabe auswirkt, typischerweise um die Generierung zu beschleunigen oder Kosten zu senken.

Modifizierte Endpunkte werden auf Artificial Analysis entsprechend gekennzeichnet und können in der Standardansicht der Bestenliste ausgeblendet sein. Nutzer, die sie anzeigen möchten, können sie weiterhin sehen. Um die Fairness unserer Standard-Benchmarks zu gewährleisten, entscheiden wir nach eigenem Ermessen, ob ein Endpunkt als modifiziert eingestuft wird und wie viele Varianten eines einzelnen Modells aufgeführt werden. Anhaltspunkte für eine Einstufung als modifiziert sind unter anderem Destillation, nur teilweise zugängliche Eingabeparameter des nativen Modells oder eine wesentlich schlechtere Ausgabequalität.

Wichtige Metriken

Mit den folgenden Metriken erfassen wir Qualität, Leistung und Preis von Videogenerierungsmodellen.

Qualitäts-Elo

Der Elo-Wert eines Modells bildet dessen relative Qualität ab und basiert auf Nutzerstimmen in der Artificial Analysis Video Arena. Dort vergleichen Nutzer zwei Videos, die verschiedene Modelle aus demselben Prompt generiert haben, und wählen das bevorzugte Video aus. Wir aggregieren diese paarweisen Abstimmungen mit einer Maximum-Likelihood-Schätzung nach Bradley-Terry und skalieren die Ergebnisse zur besseren Lesbarkeit auf einen Elo-ähnlichen Wertebereich. Die Bewertungen werden stündlich neu berechnet.

Der Elo-Wert wird für jede Modalität separat ausgewiesen (Text zu Video, Bild zu Video, Videobearbeitung, Text zu Video mit Audio, Bild zu Video mit Audio und Videobearbeitung mit Audio), da in der Arena nur Ausgaben derselben Modalität gegeneinander antreten.

Preis pro Videominute

Preis des Anbieters (USD) für die Generierung einer Videominute mit den Standardeinstellungen.

Die Preisangabe wird direkt aus dem vom jeweiligen Anbieter veröffentlichten Minutenpreis übernommen.

Generierungszeit

Median der Zeit, die der Anbieter benötigt, um mit den Standardeinstellungen ein einzelnes Video zu generieren, berechnet über die vergangenen 14 Tage.

Die Generierungszeit wird durchgängig gemessen: vom Absenden der Anfrage an den Anbieter über etwaige Wartezeiten in der Warteschlange, die Inferenz und Videocodierung bis zum Herunterladen des fertigen Videos vom Anbieter. Bei asynchronen APIs (senden → Status abfragen → herunterladen) werden alle drei Phasen berücksichtigt.

Bei Bild-zu-Video-Modellen umfasst die Generierungszeit auch die Zeit, die für das Hochladen des Referenzbilds zum Anbieter erforderlich ist. Akzeptiert ein Anbieter eine URL zum Referenzbild, entfällt dieser Schritt und die Uploadzeit wird nicht berücksichtigt.

Standardeinstellungen für die Generierung

Diese Einstellungen gelten sowohl für Text-zu-Video- als auch für Bild-zu-Video-Benchmarks, sofern nicht anders angegeben.

EinstellungWert
Auflösung1080p (oder der nächstgelegene unterstützte Wert)
Bildrate24 FPS (oder der nächstgelegene unterstützte Wert)
Dauer10 Sekunden (oder die entsprechende Anzahl an Frames, wenn die Dauer in Frames angegeben werden muss)
Seitenverhältnis16:9, Querformat
Seed42 (wenn das Modell einen Seed-Parameter bereitstellt)
Prompt-OptimierungAktiviert, wenn vom Modellentwickler empfohlen, andernfalls deaktiviert
CFG / GuidanceStandardwert der Erstanbieter-API oder des Open-Source-Repositorys
InferenzschritteStandardwert der Erstanbieter-API oder des Open-Source-Repositorys

Unterstützt ein Anbieter nicht exakt den Standardwert, verwenden wir den nächstgelegenen unterstützten Wert und entscheiden uns bei gleichem Abstand für den höheren Wert. Ist beispielsweise 24 FPS nicht verfügbar, bevorzugen wir 30 FPS gegenüber 18 FPS, da beide gleich weit vom Standardwert entfernt sind. Bei den Untermodalitäten Text zu Video mit Audio und Bild zu Video mit Audio werden Modelle mit aktivierter Audioausgabe bewertet; alle anderen Standardeinstellungen gelten unverändert.

Text zu Video

Text-zu-Video-Modelle erhalten ausschließlich einen Text-Prompt als Eingabe. Die Prompts stammen aus einem kuratierten und reproduzierbaren Prompt-Satz.

Bild zu Video

Bild-zu-Video-Modelle erhalten ein Referenzbild und, sofern unterstützt, einen begleitenden Text-Prompt. Die in unseren Benchmarks verwendeten Referenzbilder erfüllen folgende Standards:

  • Format: PNG (verlustfrei). Wir verwenden kein JPG/JPEG, um Kompressionsartefakte zu vermeiden, die durch verlustbehaftete Codierung entstehen können.
  • Auflösung: 1920×1080 (16:9, entsprechend der Zielauflösung des Videos).
  • Byte-Fallback: Akzeptiert ein Anbieter keine URLs oder verlangt er eine bestimmte Größe oder ein bestimmtes Format, laden wir das Bild herunter, nehmen die erforderlichen Umwandlungen vor und laden die Bytes direkt hoch.
  • Uploadzeit: Verlangt ein Anbieter, dass wir das Bild vor der Generierung auf seine Plattform hochladen, wird diese Uploadzeit der Generierungszeit zugerechnet.

Testmethodik für die Generierungszeit

Wichtige technische Details:

  • Taktung: Text-zu-Video-Tests werden einmal täglich zu zufälligen Zeiten ausgeführt.
  • Stichprobengröße: Die ausgewiesene Generierungszeit ist der Median der erfolgreichen Messungen aus den jeweils letzten 14 Tagen. Bei täglicher Ausführung kommen für Text zu Video in der Regel etwa 14 Stichproben pro Host und Zeitfenster zusammen.
  • Prompt-Auswahl: Bei jedem Durchlauf wird ein einzelner zufälliger Prompt aus einem kuratierten Datenbank-Pool ausgewählt und an jedes aktive Hostmodell gesendet.
  • Seed: Wenn das Modell einen Seed-Parameter bereitstellt, wird ein fester Seed von 42 verwendet, damit die Ausgaben über mehrere Durchläufe hinweg reproduzierbar sind.
  • Durchgängige Zeitmessung: Die Generierungszeit wird durchgängig vom ersten API-Aufruf bis zum Herunterladen des fertigen Videos gemessen. Bei Anbietern mit asynchronen APIs (senden, Status abfragen, herunterladen) umfasst sie die Wartezeit in der Warteschlange, die Inferenz und den Download.
  • API-Modus: Wir fragen den Auftragsstatus alle 100 Millisekunden ab, damit die gemessene Wartezeit in der Warteschlange die tatsächliche Zeit beim Anbieter und nicht das Abfrageintervall widerspiegelt.
  • Umfang: Die Generierungszeit wird derzeit nur für Text-zu-Video- und Bild-zu-Video-Modelle ohne Audio gemessen. Videobearbeitung und die drei Audiomodalitäten (Text zu Video mit Audio, Bild zu Video mit Audio und Videobearbeitung mit Audio) werden über die Video Arena (Qualitäts-Elo) eingestuft, derzeit jedoch keinem Latenz-Benchmark unterzogen.
  • Aggregation: Median, p05, p25, p75 und p95 werden aus der Rohverteilung der erfolgreichen Messungen ohne Bereinigung von Ausreißern berechnet.
  • Nicht gemessene Faktoren: Verzögerungen durch Kaltstarts beim Anbieter, Authentifizierungs-Handshakes, der Aufwand für Wiederholungsversuche und das Aufwärmen des Clients. Jeder Eintrag im Datensatz ist eine einzelne einmalige Messung.
  • Infrastruktur: Die Ausführung erfolgt auf Google Cloud Run in us-central1.
  • Neue Endpunkte: Bei neu hinzugefügten Endpunkten, einschließlich derer, die wir vor ihrer öffentlichen Verfügbarkeit bewerten, können wir die Testtaktung anpassen, um vor der Veröffentlichung der Ergebnisse eine Verteilung der Generierungszeiten zu ermitteln. Veröffentlichte Ergebnisse werden aus den Messungen der jeweils letzten 14 Tage berechnet. Werte neu gelisteter Endpunkte beruhen daher auf ersten Durchläufen und können sich ändern, wenn weitere Messungen hinzukommen.

Aufnahmekriterien für Modelle und Anbieter

Unser Ziel ist es, beliebte und leistungsstarke Videogenerierungsmodelle zu analysieren und zu vergleichen, damit Nutzer eine fundierte Auswahl treffen können. Daher prüfen wir die Branchenrelevanz und Wettbewerbsfähigkeit neuer Modelle und Anbieter, bevor wir sie aufnehmen. Wir entwickeln diese Kriterien kontinuierlich weiter und freuen uns über Feedback oder Vorschläge. Modelle oder Anbieter können Sie uns über die Kontaktseite vorschlagen.

Unabhängigkeitserklärung

Die Benchmarks werden unter strikter Wahrung von Unabhängigkeit und Objektivität durchgeführt. Artificial Analysis erhält von keinem Anbieter eine Vergütung für die Aufnahme in die Liste oder für positive Ergebnisse.