Metodología de benchmarking de generación de imágenes
Alcance y contexto
Artificial Analysis realiza benchmarking de modelos de generación de imágenes que normalmente se entregan mediante endpoints de API serverless. Esta página describe la metodología usada para medir la calidad, la velocidad y el precio de los modelos de generación de imágenes.
Para capacidades de generación de imágenes, cubrimos dos modalidades:
- Texto a imagen: modelos que generan una imagen solo a partir de un prompt de texto.
- Edición de imágenes: modelos que modifican una imagen de referencia con base en un prompt de texto.
Cobertura de endpoints
Cargas de trabajo cubiertas: el benchmarking de inferencia cubre endpoints de generación de Texto a imagen.
Solo endpoints serverless públicos: el benchmarking cubre endpoints verdaderamente serverless que están, o estarán, disponibles públicamente. Los productos de demostración, las exhibiciones de hardware y los despliegues dedicados o privados quedan fuera del alcance.
Endpoints estándar y modificados
Categorizamos cada endpoint como Estándar — sirve el modelo nativo con fidelidad completa, con sus parámetros de entrada estándar expuestos — o Modificado — alterado respecto al modelo nativo de maneras que afectan la fidelidad de la salida, normalmente para aumentar la velocidad de generación o reducir el costo.
Los endpoints modificados se etiquetan como Modificados en Artificial Analysis y pueden ocultarse de la vista predeterminada del leaderboard, permaneciendo visibles para los usuarios que eligen mostrarlos. Para preservar la equidad de nuestros benchmarks predeterminados, mantenemos discreción sobre si un endpoint se categoriza como Modificado — los indicadores incluyen destilación, exposición parcial de los parámetros de entrada nativos del modelo o calidad de salida materialmente degradada — y sobre cuántas variantes de un mismo modelo se listan.
Configuración predeterminada de generación
Generamos imágenes usando los valores predeterminados publicados por cada modelo. Para APIs propias del proveedor, esto significa los valores predeterminados documentados por la API; para modelos open source, los valores predeterminados del repositorio open source. Esto cubre pasos de inferencia, escala de guía (guidance scale) y cualquier comportamiento predeterminado de prompt negativo. Para permitir una comparación justa entre modelos, aplicamos las siguientes normalizaciones:
- Generamos en la resolución más alta que soporte cada modelo y luego reducimos su resolución a 1024×1024 para servir en nuestras Arenas.
- Generamos 1 imagen por prompt.
- Usamos una relación de aspecto 1:1.
- Usamos una semilla de 42.
Para los modelos de edición de imágenes, cada prompt se empareja con una imagen de referencia de un conjunto curado.
Métricas clave
Usamos las siguientes métricas para realizar el seguimiento de la calidad, el rendimiento y el precio en modelos de generación de imágenes.
Elo de calidad
El puntaje Elo de cada modelo refleja su calidad relativa, derivada de votos de usuarios en la Arena de imágenes. Calculamos las calificaciones usando estimación de máxima verosimilitud Bradley-Terry y las reescalamos a un rango similar a Elo para facilitar la lectura.
Cada modalidad se califica de forma independiente, ya que los enfrentamientos de la Arena solo emparejan salidas de la misma modalidad.
Precio por 1,000 imágenes
Precio del proveedor (USD) por imagen generada, multiplicado por 1,000.
El precio se toma directamente de la tarifa por imagen publicada por cada proveedor.
Tiempo de generación
Mediana del tiempo que tarda el proveedor en generar una sola imagen, calculada sobre los últimos 14 días.
Las imágenes se generan con un tamaño de lote de 1. El tiempo de generación incluye descargar la imagen del proveedor cuando se proporciona una URL en lugar de una respuesta con la imagen. Esto refleja la latencia del usuario final, ya que las URLs pueden emitirse antes de que termine la generación.
Text to Image
Resumen de la metodología
Los modelos de texto a imagen varían en capacidad a lo largo de una amplia gama de casos de uso. Un modelo puede liderar en renderizado de texto, otro en composiciones complejas o en personajes humanos fotorrealistas. El modelo que una agencia usa para creatividades de campaña no es necesariamente el que un product manager usa para mockups de UI, ni el que un estudio de videojuegos usa para concept art.
Nuestra metodología mide esta variación directamente. Clasificamos los modelos por preferencia humana sobre una taxonomía estructurada de casos de uso reales y capacidades del modelo, identificando el mejor modelo en general y el mejor modelo para un trabajo concreto. La taxonomía anticipa hacia dónde va el campo, cubriendo las capacidades que los laboratorios líderes persiguen activamente y los casos de uso donde la generación de imágenes tiene adopción real. Nuestro conjunto de prompts se renueva mensualmente para que el leaderboard siga midiendo la frontera a medida que avanza.
Curación y renovación de prompts
Mantenemos una rotación de prompts que se renuevan con regularidad para permanecer en la frontera de unas capacidades que evolucionan rápido, y para garantizar la equidad y precisión de nuestro leaderboard.
- Taxonomía de prompts: cada prompt se redacta contra una taxonomía de dos ejes, caso de uso real y capacidad del modelo, y se etiqueta con ambos. Los prompts se muestrean de forma uniforme a lo largo de la taxonomía en nuestra arena.
- Datos de usuarios reales: nuestros prompts se escriben para reflejar cómo promptean realmente los usuarios finales, informados por datos anonimizados de origen colaborativo y por un corpus de prompts curado por humanos y actualizado continuamente.
- Frescura: renovamos nuestro conjunto de prompts cada mes. Los prompts se retiran según lo bien que discriminan entre modelos y lo bien que reflejan cómo los usuarios reales promptean hoy los modelos de imagen.
Nuestro conjunto de prompts conserva la señal de los datos de usuarios reales al tiempo que ofrece una cobertura imparcial y uniforme de casos de uso y capacidades.
Taxonomía de prompts
Construimos nuestra taxonomía de prompts a lo largo de dos ejes.
Caso de uso. Estos casos de uso se basan en nuestro análisis de cómo consumidores y empresas están adoptando la generación de texto a imagen, y en nuestra observación de casos de uso emergentes. Ejemplos de tareas para cada caso de uso:
- Marketing & Advertising: creatividades publicitarias, visuales de campaña, pósteres, imagen de marca
- Retail & E-commerce: fotos de producto, ropa sobre modelo, mockups de packaging
- Live-Action Film: escenas cinematográficas, fotogramas, storyboards, hojas de personajes
- Animation & Gaming: assets de videojuegos, concept art, diseño de personajes, cómics
- Architecture & Real Estate: visualización interior y exterior, planos, home staging
- Productivity & Knowledge Work: diagramas, infografías, gráficos, diapositivas
- UI/UX Design: mockups de UI para app, web, automoción y espacial
- Consumer: portadas de libros, imágenes de stock, ilustración editorial
- Social Media & Creator Content: miniaturas, tarjetas promocionales, arte de canal y perfil
- Frontier: capacidades en la frontera actual y más allá
Capacidad. Estas capacidades del modelo se basan en nuestro trabajo continuo con los laboratorios líderes y las capacidades que persiguen, y están fundamentadas en benchmarks académicos. Ejemplos de cada capacidad:
- Reasoning: razonamiento sobre entidades, matemático, espacial y lógico, mezcla de conceptos, interpretación de modismos
- Knowledge: monumentos reales, especies y datos de dominio en ciencia y sentido común
- Text Rendering: texto largo, texto pequeño, símbolos, rotulación artística
- Layout: flujos, flechas, bloques, jerarquía visual, composiciones multipanel
- Complex Compositions: conteo preciso, relaciones espaciales, interacciones entre sujetos, asignación de atributos
- Lighting: reflejos, refracción, sombras, cáusticas
- Material: propiedades de superficie, transparencia, dispersión subsuperficial, realismo de texturas
- Physics: gravedad, apoyo, colisión, cambios térmicos y de estado
- Human Anatomy: manos, rostros, proporción corporal, poses dinámicas y movimiento
Redacción de prompts
Los prompts siguen estándares estrictos de redacción: lenguaje natural llano, un único prompt positivo con el campo de prompt negativo vacío, y una formulación neutral respecto a la arquitectura que no favorece a ninguna familia de modelos. Los prompts se filtran por redundancia en el momento de su redacción para asegurar que cubren un rango diverso de escenarios de uso reales. Los prompts se escriben:
- Para una cobertura completa de la taxonomía, distribuidos uniformemente por cada combinación de caso de uso y capacidad. Como cada prompt lleva etiquetas de caso de uso, capacidad y estilo, podemos evaluar no solo la calidad global del modelo, sino su rendimiento en los cortes concretos que importan a cada usuario. Un usuario necesita el mejor modelo para diseño de UI con jerarquía compleja de layout; otro puede necesitar planos cinematográficos impresionantes con personajes humanos realistas.
- Para reflejar cómo promptean realmente los usuarios finales, informados por prompts anonimizados de usuarios reales obtenidos de forma colaborativa y por un corpus de patrones de prompteo de consumidores curado por humanos y actualizado en vivo.
Todos los prompts son:
- En inglés
- Curados por humanos
El resultado son conjuntos de prompts de alta señal y bajo ruido, que evalúan los modelos frente a las tareas de generación más relevantes para usuarios finales y para la industria, hoy y en el futuro próximo.
Retiro de prompts
Cada mes seleccionamos prompts para retirar según estos dos criterios:
- Discriminación: si cada prompt sigue produciendo una señal clara sobre las diferencias de capacidad entre modelos. Para cada voto, etiquetamos como favorito al modelo mejor clasificado (según el leaderboard global). Los prompts cuya tasa de victoria del favorito es estadísticamente indistinguible del azar se marcan para retiro.
- Frescura/realismo: comparamos nuestro conjunto de prompts de referencia con nuestro corpus vivo, incluidos nuestros últimos prompts colaborativos y el corpus curado por humanos, para filtrar prompts que ya no reflejan las convenciones reales de prompteo.
Los prompts retirados dejan de servirse en la arena para la recolección de votos. La cadencia mensual de renovación también protege la integridad del leaderboard: un conjunto de prompts que rota no puede sobreajustarse.
Metodología de muestreo
Cada prompt de nuestro conjunto está etiquetado con 1 caso de uso y 1 etiqueta de capacidad principal. Muestreamos los prompts de forma uniforme por cada combinación de caso de uso y capacidad.
Cada enfrentamiento empareja dos resultados generados a partir del mismo prompt, dentro de la misma modalidad. La posición izquierda/derecha se aleatoriza y las identidades de los modelos solo se revelan después del voto. Los modelos recién añadidos se sobremuestrean temporalmente hasta que sus puntuaciones convergen, y los oponentes se eligen para maximizar el valor informativo de cada enfrentamiento. Cada caso de uso y capacidad aporta el mismo peso a la puntuación global del leaderboard.
Cálculo de Elo
Recolección de votos
La calidad del modelo se mide por preferencia humana.
- Votación ciega por pares: los evaluadores ven dos resultados generados a partir del mismo prompt por dos modelos distintos, sin identidades de modelo, y eligen el que prefieren.
- Pistas de evaluación: cada enfrentamiento muestra breves pistas ligadas a las etiquetas de caso de uso, capacidad y estilo del prompt, dirigiendo la atención a los aspectos bajo prueba en prompts complejos.
- Tiempo mínimo: los votos solo pueden emitirse tras un tiempo mínimo de interacción con cada resultado.
- Calidad del voto: todos los votos pasan por detección de bots y filtrado de anomalías antes de entrar en el cálculo de puntuaciones.
Filtrado de votos
Filtramos los votos según lo que mide nuestra metodología actual. Los votos anteriores a la metodología actual se emitieron sobre prompts escritos para separar una generación anterior de modelos. Los modelos actuales saturan muchos de esos prompts, con casi todos produciendo un resultado aceptable, de modo que un voto sobre ellos registra un lanzamiento de moneda en lugar de una diferencia de capacidad. Por ello aplicamos un filtro por cohortes a los votos históricos:
- Cohorte actual: modelos accesibles públicamente, de lanzamiento reciente y de mayor relevancia para nuestra audiencia. Se clasifican solo con votos recogidos bajo la metodología actual.
- Cohorte legacy: el resto de modelos. Se clasifican con todos los votos en los que aparecen, preservando su representación en el leaderboard.
- Regla: un voto se retiene si y solo si ambos modelos participantes son elegibles para él.
Este filtro se aplica después de nuestros filtros estándar de calidad de voto, incluida la exclusión de bots y spam. El Elo se recalcula desde cero sobre todo el conjunto de votos retenido, con todos los modelos, cohorte actual y legacy por igual, clasificados en ese único cálculo. La puntuación está anclada en FLUX.1 [schnell] = 1000 para el leaderboard general, y en FLUX.2 [dev] = 1000 para todos los leaderboards de subcategoría.
Metodología de prueba del tiempo de generación
Detalles técnicos clave:
- Cadencia: los benchmarks se ejecutan 4 veces al día en horarios aleatorios.
- Tamaño de muestra: el tiempo de generación principal es la mediana de mediciones exitosas de los últimos 14 días, normalmente alrededor de 56 muestras por modelo host en cada ventana.
- Qué se incluye: cada medición cronometra el ciclo de vida completo de la solicitud de una imagen, cubriendo la solicitud a la API, la inferencia del proveedor y el cuerpo de respuesta inline o la descarga de la URL al disco. Cuando los proveedores devuelven una URL, la URL suele emitirse antes de que la imagen esté completamente escrita, por lo que la descarga de bytes se cuenta para reflejar la latencia real del usuario final.
- Prompts únicos: se genera un prompt nuevo para cada llamada desde un conjunto curado, para que los proveedores no puedan devolver respuestas en caché entre ejecuciones.
- Resolución: generamos en 1024×1024. Si la resolución mínima soportada por un modelo es mayor que 1024×1024, usamos la resolución soportada más pequeña cercana a 1024×1024.
- Modo de API: usamos el endpoint síncrono del proveedor cuando existe. Para proveedores solo asíncronos, consultamos el estado del trabajo cada 100 milisegundos para que la espera en cola medida refleje el tiempo real del proveedor, no la granularidad del polling.
- Agregación: la mediana, p05, p25, p75 y p95 se calculan a partir de la distribución cruda de mediciones exitosas, sin recorte de outliers.
- Funciones del proveedor desactivadas: las marcas de agua y los controles de seguridad se desactivan cuando la API lo soporta, para eliminar fuentes de varianza de latencia no relacionadas con la velocidad de generación.
- Qué no se mide: retraso de arranque en frío (cold start) del proveedor, handshakes de autenticación, overhead de reintentos ni calentamiento del cliente. Cada entrada en el dataset es una sola medición one-shot.
- Infraestructura: se ejecuta en Google Cloud en us-central1.
- Nuevos endpoints: para endpoints recién agregados, incluidos los evaluados antes de su disponibilidad pública, podemos ajustar la cadencia de benchmarking para construir una distribución de tiempos de generación antes de listar resultados. Los resultados publicados se calculan sobre los últimos 14 días de mediciones, por lo que las cifras de endpoints recién listados reflejan ejecuciones iniciales y pueden cambiar a medida que se acumulen más mediciones.
Criterios de inclusión de modelos y proveedores
Nuestro objetivo es analizar y comparar modelos de generación de imágenes populares y de alto rendimiento para ayudar a los usuarios a elegir entre ellos. Por eso aplicamos pruebas de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Refinamos estos criterios continuamente y aceptamos con gusto comentarios o sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto.
Declaración de independencia
El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.