Metodología de benchmarking de generación de video

Alcance y contexto

Artificial Analysis realiza benchmarking de modelos de generación de video que normalmente se entregan mediante endpoints de API serverless. Esta página describe la metodología usada para medir la calidad, la velocidad y el precio de los modelos de generación de video.

Para capacidades de generación de video, cubrimos seis modalidades:

  • Texto a video: modelos que generan video solo a partir de un prompt de texto.
  • Imagen a video: modelos que generan video usando una imagen de referencia como primer fotograma y, cuando se soporta, un prompt de texto acompañante.
  • Edición de video: modelos que generan video a partir de una entrada de video y un prompt de texto.
  • Texto a video con audio: modelos de Texto a video que generan audio sincronizado junto con el video.
  • Imagen a video con audio: modelos de Imagen a video que generan audio sincronizado junto con el video.
  • Edición de video con audio: modelos de Edición de video que generan audio sincronizado junto con el video.

Cada modalidad tiene su propio pool de Elo en la Arena de video, por lo que las salidas silenciosas y con audio no se comparan directamente, y la edición no se compara con la generación.

Aplicamos un conjunto estándar de configuraciones predeterminadas a cada video que generamos en todos los modelos y proveedores. Usamos videos generados con configuraciones idénticas para cada modelo, incluidas resolución, tasa de fotogramas, duración, relación de aspecto, semilla, guidance y pasos de inferencia, para garantizar la comparabilidad. La configuración predeterminada completa se lista en Configuración predeterminada de generación más abajo.

Cobertura de endpoints

Cargas de trabajo cubiertas: el benchmarking de inferencia cubre endpoints de generación de Texto a video y de Imagen a video.

Solo endpoints serverless públicos: el benchmarking cubre endpoints verdaderamente serverless que están, o estarán, disponibles públicamente. Los productos de demostración, las exhibiciones de hardware y los despliegues dedicados o privados quedan fuera del alcance.

Endpoints estándar y modificados

Categorizamos cada endpoint como Estándar — sirve el modelo nativo con fidelidad completa, con sus parámetros de entrada estándar expuestos — o Modificado — alterado respecto al modelo nativo de maneras que afectan la fidelidad de la salida, normalmente para aumentar la velocidad de generación o reducir el costo.

Los endpoints modificados se etiquetan como Modificados en Artificial Analysis y pueden ocultarse de la vista predeterminada del leaderboard, permaneciendo visibles para los usuarios que eligen mostrarlos. Para preservar la equidad de nuestros benchmarks predeterminados, mantenemos discreción sobre si un endpoint se categoriza como Modificado — los indicadores incluyen destilación, exposición parcial de los parámetros de entrada nativos del modelo o calidad de salida materialmente degradada — y sobre cuántas variantes de un mismo modelo se listan.

Métricas clave

Usamos las siguientes métricas para realizar el seguimiento de la calidad, el rendimiento y el precio en modelos de generación de video.

Elo de calidad

El puntaje Elo de cada modelo refleja su calidad relativa, derivada de votos de usuarios en la Arena de video de Artificial Analysis. En la Arena, los usuarios comparan dos videos generados a partir del mismo prompt por modelos distintos y seleccionan el que prefieren. Agregamos estos votos por pares usando estimación de máxima verosimilitud Bradley-Terry y los reescalamos a un rango similar a Elo para facilitar la lectura. Las calificaciones se recalculan cada hora.

El Elo se reporta por separado para cada modalidad (Texto a video, Imagen a video, Edición de video, Texto a video con audio, Imagen a video con audio, Edición de video con audio), ya que los enfrentamientos de la Arena solo emparejan salidas de la misma modalidad.

Precio por minuto de video

Precio del proveedor (USD) para generar un minuto de video con la configuración predeterminada de generación.

El precio se toma directamente de la tarifa por minuto publicada por cada proveedor.

Tiempo de generación

Mediana del tiempo que tarda el proveedor en generar un solo video con la configuración predeterminada de generación, calculada sobre los últimos 14 días.

El tiempo de generación se mide de extremo a extremo: desde el momento en que se envía la solicitud al proveedor, pasando por cualquier tiempo de cola, inferencia y codificación de video, hasta la descarga del video completado desde el proveedor. Para APIs asíncronas (enviar → consultar → descargar), esto incluye las tres fases.

Para modelos de Imagen a video, el tiempo de generación también incluye cualquier tiempo necesario para subir la imagen de referencia al proveedor. Para proveedores que aceptan una URL de imagen de referencia, no hay paso de subida y el tiempo de generación excluye la subida de la imagen.

Configuración predeterminada de generación

Estas configuraciones se aplican a benchmarks de Texto a video e Imagen a video, salvo que se especifique lo contrario.

ConfiguraciónValor
Resolución1080p (o el valor soportado más cercano)
Tasa de fotogramas24 FPS (o el valor soportado más cercano)
Duración10 segundos (o el número equivalente de fotogramas cuando la duración debe especificarse en fotogramas)
Relación de aspecto16:9 horizontal
Semilla42 (cuando el modelo expone un parámetro de semilla)
Mejora de promptActivada cuando el creador del modelo lo recomienda; de lo contrario, desactivada
CFG / guidanceValor predeterminado de la API propia del proveedor, o valor predeterminado del repositorio open source
Pasos de inferenciaValor predeterminado de la API propia del proveedor, o valor predeterminado del repositorio open source

Cuando un proveedor no soporta el valor predeterminado exacto, usamos el valor soportado más cercano, desempatando hacia arriba (por ejemplo, cuando 24 FPS no está disponible, preferimos 30 FPS sobre 18 FPS, ya que ambos están a la misma distancia del valor predeterminado). Las submodalidades Texto a video con audio e Imagen a video con audio evalúan modelos con salida de audio activada; todos los demás valores predeterminados se aplican.

Texto a video

Los modelos de Texto a video toman un prompt de texto como única entrada. Los prompts se extraen de un conjunto de prompts curado y reproducible.

Imagen a video

Los modelos de Imagen a video toman una imagen de referencia y, cuando se soporta, un prompt de texto acompañante. Las imágenes de referencia usadas en nuestros benchmarks siguen estos estándares:

  • Formato: PNG (sin pérdida). No usamos JPG/JPEG para evitar los artefactos de compresión que puede introducir la codificación con pérdida.
  • Resolución: 1920×1080 (16:9, coincidente con la resolución objetivo del video).
  • Carga directa de bytes: Cuando un proveedor no acepta URLs, o requiere un tamaño o formato específico, descargamos la imagen, aplicamos las transformaciones requeridas y subimos los bytes directamente.
  • Tiempo de subida: Cuando un proveedor requiere que subamos la imagen a su plataforma como paso previo a la generación, ese tiempo de subida cuenta dentro del tiempo de generación.

Metodología de prueba del tiempo de generación

Detalles técnicos clave:

  • Cadencia: Texto a video se ejecuta una vez al día en horarios aleatorios.
  • Tamaño de muestra: el tiempo de generación principal es la mediana de mediciones exitosas de los últimos 14 días. Con cadencia diaria, Texto a video normalmente acumula alrededor de 14 muestras por host en cada ventana.
  • Selección de prompt: cada ejecución toma un solo prompt aleatorio de un pool curado de base de datos y lo envía a cada modelo host activo.
  • Semilla: se usa una semilla fija de 42 cuando el modelo expone un parámetro de semilla, para que las salidas sean reproducibles entre ejecuciones.
  • Medición de extremo a extremo: el tiempo de generación se mide de extremo a extremo, desde la primera llamada a la API hasta la descarga del video completado. Para proveedores con APIs asíncronas (enviar, consultar, descargar), incluye espera en cola, inferencia y descarga.
  • Modo de API: consultamos el estado del trabajo cada 100 milisegundos para que la espera en cola medida refleje el tiempo real del proveedor, no la granularidad del polling.
  • Alcance: actualmente el tiempo de generación se mide solo para modelos silenciosos de Texto a video e Imagen a video. Edición de video y las tres modalidades con audio (Texto a video con audio, Imagen a video con audio, Edición de video con audio) se clasifican mediante la Arena de video (Elo de calidad), pero actualmente no tienen benchmark de latencia.
  • Agregación: la mediana, p05, p25, p75 y p95 se calculan a partir de la distribución cruda de mediciones exitosas, sin recorte de outliers.
  • Qué no se mide: retraso de arranque en frío (cold start) del proveedor, handshakes de autenticación, overhead de reintentos ni calentamiento del cliente. Cada entrada en el dataset es una medición única.
  • Infraestructura: se ejecuta en Google Cloud Run en us-central1.
  • Nuevos endpoints: para endpoints recién agregados, incluidos los evaluados antes de su disponibilidad pública, podemos ajustar la cadencia de benchmarking para construir una distribución de tiempos de generación antes de listar resultados. Los resultados publicados se calculan sobre los últimos 14 días de mediciones, por lo que las cifras de endpoints recién listados reflejan ejecuciones iniciales y pueden cambiar a medida que se acumulen más mediciones.

Criterios de inclusión de modelos y proveedores

Nuestro objetivo es analizar y comparar modelos de generación de video populares y de alto rendimiento para ayudar a los usuarios a elegir entre ellos. Por eso aplicamos pruebas de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Refinamos estos criterios continuamente y aceptamos con gusto comentarios o sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto.

Declaración de independencia

El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.