Metodología de benchmarking de generación de video
Alcance y contexto
Artificial Analysis realiza benchmarking de modelos de generación de video que normalmente se entregan mediante endpoints de API serverless. Esta página describe la metodología usada para medir la calidad, la velocidad y el precio de los modelos de generación de video.
Para capacidades de generación de video, publicamos seis benchmarks:
- AA-Video-T2V-Silent v2.0: modelos que generan video solo a partir de un prompt de texto.
- AA-Video-I2V-Silent v1.0: modelos que generan video usando una imagen de referencia como primer fotograma y, cuando se soporta, un prompt de texto acompañante.
- AA-Video-Editing-Silent v1.1: modelos que generan video a partir de una entrada de video y un prompt de texto.
- AA-Video-T2V v2.0: modelos de Texto a video que generan audio sincronizado junto con el video.
- AA-Video-I2V v1.0: modelos de Imagen a video que generan audio sincronizado junto con el video.
- AA-Video-Editing v1.1: modelos de Edición de video que generan audio sincronizado junto con el video.
Cada benchmark tiene su propio pool de Elo en la Arena de video, por lo que las salidas silenciosas y con audio no se comparan directamente, y la edición no se compara con la generación.
Aplicamos un conjunto estándar de configuraciones predeterminadas a cada video que generamos en todos los modelos y proveedores. Usamos videos generados con configuraciones idénticas para cada modelo, incluidas resolución, tasa de fotogramas, duración, relación de aspecto, semilla, guidance y pasos de inferencia, para garantizar la comparabilidad. La configuración predeterminada completa se lista en Configuración predeterminada de generación más abajo.
Cobertura de endpoints
Cargas de trabajo cubiertas: el benchmarking de inferencia cubre endpoints de generación de Texto a video y de Imagen a video.
Solo endpoints serverless públicos: el benchmarking cubre endpoints verdaderamente serverless que están, o estarán, disponibles públicamente. Los productos de demostración, las exhibiciones de hardware y los despliegues dedicados o privados quedan fuera del alcance.
Endpoints estándar y modificados
Categorizamos cada endpoint como Estándar — sirve el modelo nativo con fidelidad completa, con sus parámetros de entrada estándar expuestos — o Modificado — alterado respecto al modelo nativo de maneras que afectan la fidelidad de la salida, normalmente para aumentar la velocidad de generación o reducir el costo.
Los endpoints modificados se etiquetan como Modificados en Artificial Analysis y pueden ocultarse de la vista predeterminada del leaderboard, permaneciendo visibles para los usuarios que eligen mostrarlos. Para preservar la equidad de nuestros benchmarks predeterminados, mantenemos discreción sobre si un endpoint se categoriza como Modificado — los indicadores incluyen destilación, exposición parcial de los parámetros de entrada nativos del modelo o calidad de salida materialmente degradada — y sobre cuántas variantes de un mismo modelo se listan.
Métricas clave
Usamos las siguientes métricas para realizar el seguimiento de la calidad, el rendimiento y el precio en modelos de generación de video.
Elo de calidad
El puntaje Elo de cada modelo refleja su calidad relativa, derivada de votos ciegos de nuestro panel reclutado, junto con los votos públicos emitidos en la Arena de video de Artificial Analysis antes del 1 de enero de 2026. En ambos casos, quienes votan comparan dos videos generados a partir del mismo prompt por modelos distintos y seleccionan el que prefieren. Los votos públicos anteriores a esa fecha solo existen en Texto a video e Imagen a video, y ahora solo cuentan para Imagen a video: los benchmarks de Texto a video se reiniciaron para v2.0 (consulta AA-Video-T2V v2.0 y AA-Video-T2V-Silent v2.0 más abajo). Edición de video y las tres modalidades con audio recibieron su primer voto público después, por lo que sus puntajes se basan únicamente en los votos del panel. Agregamos estos votos por pares usando estimación de máxima verosimilitud Bradley-Terry y los reescalamos a un rango similar a Elo para facilitar la lectura. Las calificaciones se recalculan cada hora.
El Elo se reporta por separado para cada benchmark (AA-Video-T2V-Silent v2.0, AA-Video-I2V-Silent v1.0, AA-Video-Editing-Silent v1.1, AA-Video-T2V v2.0, AA-Video-I2V v1.0, AA-Video-Editing v1.1), ya que los enfrentamientos de la Arena solo emparejan salidas de la misma modalidad.
Leaderboards
Publicamos un leaderboard global para cada benchmark. AA-Video-T2V v2.0 y AA-Video-T2V-Silent v2.0 también publican leaderboards por categoría (ver más abajo).
- Leaderboard global: la clasificación publicada en este sitio, que agrega todos los votos retenidos por las reglas anteriores. Un modelo aparece en cuanto ha recibido un número mínimo de votos.
Precio por minuto de video
Precio del proveedor (USD) para generar un minuto de video con la configuración predeterminada de generación.
El precio se toma directamente de la tarifa por minuto publicada por cada proveedor.
Tiempo de generación
Mediana del tiempo que tarda el proveedor en generar un solo video con la configuración predeterminada de generación, calculada sobre los últimos 3 días.
El tiempo de generación se mide de extremo a extremo: desde el momento en que se envía la solicitud al proveedor, pasando por cualquier tiempo de cola, inferencia y codificación de video, hasta la descarga del video completado desde el proveedor. Para APIs asíncronas (enviar → consultar → descargar), esto incluye las tres fases.
Para modelos de Imagen a video, el tiempo de generación también incluye cualquier tiempo necesario para subir la imagen de referencia al proveedor. Para proveedores que aceptan una URL de imagen de referencia, no hay paso de subida y el tiempo de generación excluye la subida de la imagen.
Configuración predeterminada de generación
Estas configuraciones se aplican a benchmarks de Texto a video e Imagen a video, salvo que se especifique lo contrario.
| Configuración | Valor |
|---|---|
| Resolución | 1080p (o el valor soportado más cercano) |
| Tasa de fotogramas | 24 FPS (o el valor soportado más cercano) |
| Duración | 10 segundos (o el número equivalente de fotogramas cuando la duración debe especificarse en fotogramas) |
| Relación de aspecto | 16:9 horizontal |
| Semilla | 42 (cuando el modelo expone un parámetro de semilla) |
| Mejora de prompt | Activada cuando el creador del modelo lo recomienda; de lo contrario, desactivada |
| CFG / guidance | Valor predeterminado de la API propia del proveedor, o valor predeterminado del repositorio open source |
| Pasos de inferencia | Valor predeterminado de la API propia del proveedor, o valor predeterminado del repositorio open source |
Cuando un proveedor no soporta el valor predeterminado exacto, usamos el valor soportado más cercano, desempatando hacia arriba (por ejemplo, cuando 24 FPS no está disponible, preferimos 30 FPS sobre 18 FPS, ya que ambos están a la misma distancia del valor predeterminado). AA-Video-T2V v2.0 y AA-Video-I2V v1.0 evalúan modelos con salida de audio activada; todos los demás valores predeterminados se aplican.
Texto a video
Los modelos de Texto a video toman un prompt de texto como única entrada. Los prompts se extraen de un conjunto de prompts curado y reproducible.
Imagen a video
Los modelos de Imagen a video toman una imagen de referencia y, cuando se soporta, un prompt de texto acompañante. Las imágenes de referencia usadas en nuestros benchmarks siguen estos estándares:
- Formato: PNG (sin pérdida). No usamos JPG/JPEG para evitar los artefactos de compresión que puede introducir la codificación con pérdida.
- Resolución: 1920×1080 (16:9, coincidente con la resolución objetivo del video).
- Carga directa de bytes: Cuando un proveedor no acepta URLs, o requiere un tamaño o formato específico, descargamos la imagen, aplicamos las transformaciones requeridas y subimos los bytes directamente.
- Tiempo de subida: Cuando un proveedor requiere que subamos la imagen a su plataforma como paso previo a la generación, ese tiempo de subida cuenta dentro del tiempo de generación.
AA-Video-T2V v2.0 y AA-Video-T2V-Silent v2.0
Resumen de la metodología
Los modelos de texto a video varían en capacidad entre casos de uso. Un modelo puede liderar en actuación humana y sincronización labial, otro en animación, texto en pantalla o movimiento de UI. El modelo que un estudio elige para un film de marca no es necesariamente el que un equipo de producto elige para demos de movimiento de UI, ni el que un creador elige para clips para redes sociales.
Nuestra metodología mide esta variación directamente. Clasificamos los modelos por preferencia humana sobre una taxonomía de casos de uso reales y capacidades del modelo, identificando el mejor modelo en general y el mejor modelo para un trabajo concreto. Renovamos nuestro conjunto de prompts con regularidad para que el leaderboard siga midiendo la frontera a medida que avanza.
AA-Video-T2V v2.0 evalúa Texto a video con audio. AA-Video-T2V-Silent v2.0 evalúa Texto a video sin audio.
Curación y renovación de prompts
Mantenemos un conjunto de prompts curado, renovado con regularidad para seguir la frontera a medida que evolucionan las capacidades de los modelos.
- Taxonomía de prompts: cada prompt se redacta contra dos ejes, caso de uso real y capacidad del modelo, y se etiqueta con ambos. Cada prompt también se etiqueta con su estilo visual. Los prompts se muestrean de forma uniforme por caso de uso y capacidad en nuestra arena.
- Conjuntos de prompts: AA-Video-T2V v2.0 usa 1000 prompts. AA-Video-T2V-Silent v2.0 usa 500 prompts.
- Frescura: renovamos nuestro conjunto de prompts con regularidad. Los prompts se retiran cuando ya no separan a los modelos o ya no reflejan cómo las personas promptean hoy los modelos de video.
Taxonomía de prompts
Construimos nuestra taxonomía de prompts a lo largo de dos ejes y etiquetamos el estilo visual por separado.
Caso de uso. Estos casos de uso se basan en nuestro análisis de cómo consumidores y empresas están adoptando la generación de texto a video, y en nuestra observación de casos de uso emergentes. Ejemplos de tareas para cada caso de uso:
- Marketing & Advertising: pósteres animados, animaciones breves de logo, films de marca, spots protagonizados por el producto, videos de lanzamiento
- Retail & E-commerce: tomas de producto en estudio, demos de producto, movimiento de ropa y moda, testimonios estilo creador, pruebas de outfits
- Live-Action Film: planos cinematográficos, episodios de microdrama, previsualización
- Animation & Gaming: escenas animadas, tráileres de videojuegos, previsualización para animación y videojuegos
- Architecture & Real Estate: recorridos aéreos de exteriores, recorridos de interiores, home staging virtual
- Productivity & Knowledge Work: videos explicativos, videos educativos y de formación, visualizaciones de datos animadas, simulaciones de escenarios
- UI/UX & Motion Design: tipografía cinética, demos de movimiento de UI en distintos dispositivos, motion graphics abstractos
- Consumer: selfies, momentos personales, metraje de stock cotidiano y b-roll
- Social Media & Creator Content: personas hablando a cámara, clips de podcast, videos ASMR y satisfactorios, baile, vlogs, formatos en tendencia
- Frontier: capacidades en la frontera actual y más allá
Capacidad. Estas capacidades del modelo se basan en nuestro trabajo continuo con los laboratorios líderes y las capacidades que persiguen, y están fundamentadas en benchmarks académicos. Ejemplos de cada capacidad:
- Physics: mecánica, efectos térmicos, interacciones entre materiales, fractura y deformación, óptica, causa y efecto, física contrafactual
- Complex Composition: asignación de atributos, relaciones espaciales, interacción entre múltiples objetos, conteo, orden temporal
- Human Anatomy: marcha y locomoción, motricidad fina, expresión facial, movimientos acrobáticos, agarre de objetos, interacción humana
- Lighting & Materials: iluminación, exposición, sombras, temperatura de color, textura, tela, cabello y pelaje
- Multi-Scene & Narrative: historias con múltiples eventos, transiciones entre planos, montaje, consistencia de identidad entre planos
- Camera Control: tipos de plano como primer plano, aéreo, POV y contrapicado, y movimientos como travelling, dolly, órbita, grúa, crash zoom, whip pan y cambio de foco
- Text Rendering: texto corto y largo, layout 2D, cadenas no léxicas, texto sobre superficies que se deforman
- Spatio-Temporal Consistency: coherencia espacial, time lapses, oclusión y reaparición, historias en un solo plano
- Audio Synchronization: efectos de sonido diegéticos, música de fondo y banda sonora, sonido dentro y fuera de cuadro
- Dialogue & Lip Sync: diálogo con uno y varios hablantes, voz en off frente a habla en pantalla
Estilo. Cada prompt también se etiqueta con uno de ocho estilos visuales: Photorealistic, 3D Render/CGI, Cartoon and Anime, Flat Design, Hand-drawn/Illustration, Stop-Motion/Claymation, Lo-Fi y Mixed Styles. Los estilos no se muestrean de forma uniforme, y la mayoría de los prompts son fotorrealistas.
Redacción de prompts
Escribimos los prompts para separar a los modelos de video de frontera, que resuelven bien las solicitudes simples. Los prompts se escriben:
- Para una cobertura completa de la taxonomía, distribuidos uniformemente por cada combinación de caso de uso y capacidad, con un umbral alto de complejidad en cada capacidad, como movimiento a gran escala en lugar de sutil y múltiples sujetos que interactúan.
- Para reflejar trabajo de producción real, basados en las guías de prompting de los desarrolladores de modelos, nuestros conjuntos de prompts existentes y los flujos de trabajo que vemos en la industria.
- Pensando en el sonido para AA-Video-T2V v2.0: los prompts especifican diálogo, efectos de sonido, ambiente y música cuando la escena lo requiere.
Una persona revisa cada prompt antes de que lo sirvamos en la arena.
Retiro de prompts
Retiramos prompts cuando los votos de la arena muestran que ya no separan a los modelos, o cuando ya no reflejan cómo las personas promptean los modelos de video.
Metodología de muestreo
Para cada enfrentamiento, muestreamos de forma uniforme entre las combinaciones de caso de uso y capacidad, y luego elegimos un prompt al azar dentro de la combinación seleccionada.
Cada enfrentamiento empareja dos videos generados a partir del mismo prompt, dentro del mismo benchmark, por lo que los videos con audio nunca se emparejan con videos silenciosos. La posición izquierda/derecha se aleatoriza.
Estándares de reproducción
Servimos cada video a los evaluadores bajo los mismos estándares:
- Resolución: hasta 1080p, tal como se generó. Los videos nunca se reescalan hacia arriba: los modelos que no pueden generar 1080p se sirven a su resolución máxima soportada, y las salidas por encima de 1080p se reducen a 1080p.
- Codificación: H.264 en alta calidad, con picos de bitrate limitados a 10 Mbps.
- Duración: 10 segundos en 16:9. Los modelos que no pueden generar 10 segundos se sirven con su duración máxima.
- Nivelación de audio: para AA-Video-T2V v2.0, nivelamos la sonoridad de cada video hacia -18 LUFS con una única ganancia fija. La mezcla de un modelo nunca se comprime ni se remasteriza, y ningún modelo gana por sonar más fuerte.
Cálculo de Elo
Recolección de votos
La calidad del modelo se mide por preferencia humana.
- Votación ciega por pares: los evaluadores ven dos videos generados a partir del mismo prompt por dos modelos distintos, sin identidades de modelo, y eligen el que prefieren. Ambos videos se reproducen a tamaño completo en un único reproductor, y los evaluadores alternan entre ellos.
- Pistas de evaluación: cada enfrentamiento muestra breves pistas ligadas al caso de uso, la capacidad principal y el estilo del prompt, dirigiendo la atención a los aspectos concretos bajo prueba.
- Tiempo mínimo: los votos solo pueden emitirse después de que cada video se haya reproducido durante al menos 8 segundos. Para AA-Video-T2V v2.0, se pide a los evaluadores que también juzguen el sonido, usando auriculares.
- Calidad del voto: ambos leaderboards se clasifican únicamente con votos de nuestro panel reclutado, filtrado y verificado por el proveedor del panel. Aproximadamente uno de cada cinco enfrentamientos de cada sesión es un control de calidad con una respuesta de fuerte consenso. Las sesiones que no superan estos controles se rechazan y se eliminan todos sus votos, y los votos de control de calidad no cuentan en la calificación.
Filtrado de votos
AA-Video-T2V v2.0 y AA-Video-T2V-Silent v2.0 son leaderboards nuevos. Retiramos todos los votos de Texto a video emitidos antes de la renovación, para todos los modelos, porque se recogieron con prompts y estándares de reproducción anteriores. Los votos públicos de la Arena de video no cuentan para estas calificaciones. Calculamos el Elo desde cero sobre los votos retenidos, anclado en Kling 3.0 1080p (Pro) = 1000 para el leaderboard general y para todos los leaderboards de subcategoría.
Leaderboards
Para cada benchmark publicamos:
- Leaderboard general: la clasificación sobre todos los votos retenidos. Un modelo aparece en cuanto ha recibido un número mínimo de votos.
- Leaderboards por categoría: el mismo cálculo restringido a los prompts etiquetados con un caso de uso, una capacidad o un estilo determinados, publicados una vez que la categoría tiene suficientes votos.
AA-Video-Editing v1.1 y AA-Video-Editing-Silent v1.1
Resumen de la metodología
La v1.1 lleva Edición de video a un estándar de 1080p para los modelos recientes. La arena sirve salidas en 1080p. MiniMax H3 se sirve en 768p, su resolución nativa máxima, porque su nivel 2K es un reescalado.
AA-Video-Editing v1.1 evalúa Edición de video con audio. AA-Video-Editing-Silent v1.1 evalúa Edición de video sin audio.
Cambios respecto a la v1.0
- Modelos añadidos: Gemini Omni Flash 1.1, MiniMax H3 (768p), Dreamina Seedance 2.0 (1080p) y Dreamina Seedance 2.5.
- Modelos retirados: Gemini Omni Flash (720p), MiniMax H3 (2K), Dreamina Seedance 2.0 720p y FLUX 3. El modo de video a video de FLUX 3 continúa un clip en lugar de editarlo.
- Conjuntos de prompts: AA-Video-Editing v1.1 usa 145 clips de origen con audio. AA-Video-Editing-Silent v1.1 usa 102 clips de origen sin audio. Ambos conjuntos no cambian respecto a la v1.0.
Cobertura parcial de prompts
Algunos modelos rechazan parte del conjunto de prompts, como clips de origen con personas reales, material con derechos de autor o ediciones del habla. El Elo de esos modelos usa solo los prompts que completaron, y una nota en el modelo lo indica.
Metodología de prueba del tiempo de generación
Detalles técnicos clave:
- Cadencia: Texto a video se ejecuta cada 2 horas con un desfase aleatorio dentro de cada ventana.
- Tamaño de muestra: el tiempo de generación principal es la mediana de mediciones exitosas de los últimos 3 días. Con mediciones cada 2 horas, Texto a video normalmente acumula alrededor de 36 muestras por host en cada ventana.
- Selección de prompt: cada ejecución toma un solo prompt aleatorio de un pool curado de base de datos y lo envía a cada modelo host activo.
- Semilla: se usa una semilla fija de 42 cuando el modelo expone un parámetro de semilla, para que las salidas sean reproducibles entre ejecuciones.
- Medición de extremo a extremo: el tiempo de generación se mide de extremo a extremo, desde la primera llamada a la API hasta la descarga del video completado. Para proveedores con APIs asíncronas (enviar, consultar, descargar), incluye espera en cola, inferencia y descarga.
- Modo de API: consultamos el estado del trabajo cada 100 milisegundos para que la espera en cola medida refleje el tiempo real del proveedor, no la granularidad del polling.
- Alcance: actualmente el tiempo de generación se mide solo para modelos silenciosos de Texto a video e Imagen a video. AA-Video-Editing-Silent v1.1 y los tres benchmarks con audio (AA-Video-T2V v2.0, AA-Video-I2V v1.0, AA-Video-Editing v1.1) se clasifican mediante la Arena de video (Elo de calidad), pero actualmente no tienen benchmark de latencia.
- Agregación: la mediana, p05, p25, p75 y p95 se calculan a partir de la distribución cruda de mediciones exitosas, sin recorte de outliers.
- Qué no se mide: retraso de arranque en frío (cold start) del proveedor, handshakes de autenticación, overhead de reintentos ni calentamiento del cliente. Cada entrada en el dataset es una medición única.
- Infraestructura: se ejecuta en Google Cloud Run en us-central1.
- Nuevos endpoints: para endpoints recién agregados, incluidos los evaluados antes de su disponibilidad pública, podemos ajustar la cadencia de benchmarking para construir una distribución de tiempos de generación antes de listar resultados. Los resultados publicados se calculan sobre los últimos 3 días de mediciones, por lo que las cifras de endpoints recién listados reflejan ejecuciones iniciales y pueden cambiar a medida que se acumulen más mediciones.
Criterios de inclusión de modelos y proveedores
Nuestro objetivo es analizar y comparar modelos de generación de video populares y de alto rendimiento para ayudar a los usuarios a elegir entre ellos. Por eso aplicamos pruebas de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Refinamos estos criterios continuamente y aceptamos con gusto comentarios o sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto.
Declaración de independencia
El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.