Metodología de benchmarking de generación de imágenes
Alcance y contexto
Artificial Analysis realiza benchmarking de modelos de generación de imágenes que normalmente se entregan mediante endpoints de API serverless. Esta página describe la metodología usada para medir la calidad, la velocidad y el precio de los modelos de generación de imágenes.
Para capacidades de generación de imágenes, cubrimos dos modalidades:
- Texto a imagen: modelos que generan una imagen solo a partir de un prompt de texto.
- Edición de imágenes: modelos que modifican una imagen de referencia con base en un prompt de texto.
Cobertura de endpoints
Cargas de trabajo cubiertas: el benchmarking de inferencia cubre endpoints de generación de Texto a imagen.
Solo endpoints serverless públicos: el benchmarking cubre endpoints verdaderamente serverless que están, o estarán, disponibles públicamente. Los productos de demostración, las exhibiciones de hardware y los despliegues dedicados o privados quedan fuera del alcance.
Endpoints estándar y modificados
Categorizamos cada endpoint como Estándar — sirve el modelo nativo con fidelidad completa, con sus parámetros de entrada estándar expuestos — o Modificado — alterado respecto al modelo nativo de maneras que afectan la fidelidad de la salida, normalmente para aumentar la velocidad de generación o reducir el costo.
Los endpoints modificados se etiquetan como Modificados en Artificial Analysis y pueden ocultarse de la vista predeterminada del leaderboard, permaneciendo visibles para los usuarios que eligen mostrarlos. Para preservar la equidad de nuestros benchmarks predeterminados, mantenemos discreción sobre si un endpoint se categoriza como Modificado — los indicadores incluyen destilación, exposición parcial de los parámetros de entrada nativos del modelo o calidad de salida materialmente degradada — y sobre cuántas variantes de un mismo modelo se listan.
Configuración predeterminada de generación
Generamos imágenes usando los valores predeterminados publicados por cada modelo. Para APIs propias del proveedor, esto significa los valores predeterminados documentados por la API; para modelos open source, los valores predeterminados del repositorio open source. Esto cubre pasos de inferencia, escala de guía (guidance scale) y cualquier comportamiento predeterminado de prompt negativo. Para permitir una comparación justa entre modelos, aplicamos las siguientes normalizaciones:
- Generamos en la resolución más alta que soporte cada modelo y luego reducimos su resolución a 1024×1024 para servir en nuestras Arenas.
- Generamos 1 imagen por prompt.
- Usamos una relación de aspecto 1:1.
- Usamos una semilla de 42.
Para los modelos de edición de imágenes, cada prompt se empareja con una imagen de referencia de un conjunto curado.
Métricas clave
Usamos las siguientes métricas para realizar el seguimiento de la calidad, el rendimiento y el precio en modelos de generación de imágenes.
Elo de calidad
El puntaje Elo de cada modelo refleja su calidad relativa, derivada de votos de usuarios en la Arena de imágenes. Calculamos las calificaciones usando estimación de máxima verosimilitud Bradley-Terry y las reescalamos a un rango similar a Elo para facilitar la lectura.
Cada modalidad se califica de forma independiente, ya que los enfrentamientos de la Arena solo emparejan salidas de la misma modalidad.
Precio por 1,000 imágenes
Precio del proveedor (USD) por imagen generada, multiplicado por 1,000.
El precio se toma directamente de la tarifa por imagen publicada por cada proveedor.
Tiempo de generación
Mediana del tiempo que tarda el proveedor en generar una sola imagen, calculada sobre los últimos 14 días.
Las imágenes se generan con un tamaño de lote de 1. El tiempo de generación incluye descargar la imagen del proveedor cuando se proporciona una URL en lugar de una respuesta con la imagen. Esto refleja la latencia del usuario final, ya que las URLs pueden emitirse antes de que termine la generación.
Metodología de prueba del tiempo de generación
Detalles técnicos clave:
- Cadencia: los benchmarks se ejecutan 4 veces al día en horarios aleatorios.
- Tamaño de muestra: el tiempo de generación principal es la mediana de mediciones exitosas de los últimos 14 días, normalmente alrededor de 56 muestras por modelo host en cada ventana.
- Qué se incluye: cada medición cronometra el ciclo de vida completo de la solicitud de una imagen, cubriendo la solicitud a la API, la inferencia del proveedor y el cuerpo de respuesta inline o la descarga de la URL al disco. Cuando los proveedores devuelven una URL, la URL suele emitirse antes de que la imagen esté completamente escrita, por lo que la descarga de bytes se cuenta para reflejar la latencia real del usuario final.
- Prompts únicos: se genera un prompt nuevo para cada llamada desde un conjunto curado, para que los proveedores no puedan devolver respuestas en caché entre ejecuciones.
- Resolución: generamos en 1024×1024. Si la resolución mínima soportada por un modelo es mayor que 1024×1024, usamos la resolución soportada más pequeña cercana a 1024×1024.
- Modo de API: usamos el endpoint síncrono del proveedor cuando existe. Para proveedores solo asíncronos, consultamos el estado del trabajo cada 100 milisegundos para que la espera en cola medida refleje el tiempo real del proveedor, no la granularidad del polling.
- Agregación: la mediana, p05, p25, p75 y p95 se calculan a partir de la distribución cruda de mediciones exitosas, sin recorte de outliers.
- Funciones del proveedor desactivadas: las marcas de agua y los controles de seguridad se desactivan cuando la API lo soporta, para eliminar fuentes de varianza de latencia no relacionadas con la velocidad de generación.
- Qué no se mide: retraso de arranque en frío (cold start) del proveedor, handshakes de autenticación, overhead de reintentos ni calentamiento del cliente. Cada entrada en el dataset es una sola medición one-shot.
- Infraestructura: se ejecuta en Google Cloud en us-central1.
- Nuevos endpoints: para endpoints recién agregados, incluidos los evaluados antes de su disponibilidad pública, podemos ajustar la cadencia de benchmarking para construir una distribución de tiempos de generación antes de listar resultados. Los resultados publicados se calculan sobre los últimos 14 días de mediciones, por lo que las cifras de endpoints recién listados reflejan ejecuciones iniciales y pueden cambiar a medida que se acumulen más mediciones.
Criterios de inclusión de modelos y proveedores
Nuestro objetivo es analizar y comparar modelos de generación de imágenes populares y de alto rendimiento para ayudar a los usuarios a elegir entre ellos. Por eso aplicamos pruebas de relevancia en la industria y rendimiento competitivo para evaluar la inclusión de nuevos modelos y proveedores. Refinamos estos criterios continuamente y aceptamos con gusto comentarios o sugerencias. Para sugerir modelos o proveedores, contáctanos mediante la página de contacto.
Declaración de independencia
El benchmarking se realiza con estricta independencia y objetividad. No recibimos compensación de ningún proveedor por aparecer listado ni por resultados favorables en Artificial Analysis.