Metodologia de benchmark de geração de imagens
Escopo e contexto
A Artificial Analysis realiza benchmarks de modelos de geração de imagens normalmente oferecidos por endpoints de API serverless. Esta página descreve a metodologia usada para medir a qualidade, a velocidade e o preço dos modelos de geração de imagens.
Para os recursos de geração de imagens, cobrimos duas modalidades:
- Texto para imagem: modelos que geram uma imagem usando apenas um prompt de texto.
- Edição de imagens: modelos que modificam uma imagem de referência com base em um prompt de texto.
Cobertura de endpoints
Cargas de trabalho cobertas: o benchmark de inferência abrange endpoints de geração de texto para imagem.
Apenas endpoints serverless públicos: o benchmark abrange endpoints realmente serverless que estão ou estarão disponíveis publicamente. Produtos de demonstração, apresentações de hardware e implantações dedicadas ou privadas não fazem parte do escopo.
Endpoints padrão e modificados
Classificamos cada endpoint como Padrão — que oferece o modelo nativo com total fidelidade e expõe seus parâmetros de entrada padrão — ou Modificado — que altera o modelo nativo de formas que afetam a fidelidade da saída, normalmente para aumentar a velocidade de geração ou reduzir o custo.
Os endpoints modificados recebem o rótulo Modificado na Artificial Analysis e podem ser ocultados na visualização padrão do ranking, permanecendo visíveis para os usuários que optarem por exibi-los. Para preservar a imparcialidade dos nossos benchmarks padrão, cabe a nós decidir se um endpoint será classificado como Modificado — os indicadores incluem destilação, exposição parcial dos parâmetros de entrada nativos do modelo ou redução significativa na qualidade da saída — e quantas variantes de um mesmo modelo serão listadas.
Configurações padrão de geração
Geramos imagens usando as configurações padrão publicadas de cada modelo. Para APIs próprias, isso significa as configurações padrão documentadas da API; para modelos de pesos abertos, as configurações padrão do repositório de código aberto. Isso inclui etapas de inferência, escala de orientação (guidance scale) e qualquer comportamento padrão de prompts negativos. Para possibilitar uma comparação justa entre os modelos, aplicamos as seguintes normalizações:
- Geramos na maior resolução compatível com cada modelo e depois reduzimos para 1024×1024 para exibição em nossas Arenas.
- Geramos 1 imagem por prompt.
- Usamos uma proporção de 1:1.
- Usamos uma semente de 42.
Nos modelos de edição de imagens, cada prompt é associado a uma imagem de referência de um conjunto selecionado.
Principais métricas
Usamos as métricas a seguir para acompanhar a qualidade, o desempenho e o preço dos modelos de geração de imagens.
Elo de qualidade
A pontuação Elo de cada modelo reflete sua qualidade relativa, derivada dos votos dos usuários na Image Arena. Calculamos as classificações usando a estimativa de máxima verossimilhança de Bradley-Terry e as redimensionamos para uma faixa semelhante ao Elo para facilitar a leitura.
Cada modalidade recebe uma pontuação independente, pois as disputas na Arena combinam apenas saídas da mesma modalidade.
Preço por 1.000 imagens
Preço do provedor (USD) por imagem gerada, multiplicado por 1.000.
O preço é obtido diretamente da tarifa por imagem publicada por cada provedor.
Tempo de geração
Mediana do tempo que o provedor leva para gerar uma única imagem, calculada nos últimos 14 dias.
As imagens são geradas com um tamanho de lote igual a 1. O tempo de geração inclui o download da imagem do provedor quando ele fornece uma URL em vez da imagem na resposta. Isso reflete a latência para o usuário final, pois as URLs podem ser disponibilizadas antes do término da geração.
Text to Image
Visão geral da metodologia
Modelos de texto para imagem variam em capacidade em uma ampla gama de casos de uso. Um modelo pode liderar em renderização de texto, outro em layouts complexos ou personagens humanos fotorrealistas. O modelo que uma agência usa para criativos de campanha não é necessariamente o que um gerente de produto usa para mockups de UI, nem o que um estúdio de games usa para concept art.
Nossa metodologia mede essa variação diretamente. Classificamos modelos por preferência humana sobre uma taxonomia estruturada de casos de uso reais e capacidades de modelo, identificando o melhor modelo no geral e o melhor modelo para um trabalho específico. A taxonomia antecipa para onde o campo está indo, cobrindo as capacidades que os principais laboratórios perseguem ativamente e os casos de uso em que a geração de imagens tem adoção real. Nosso conjunto de prompts é renovado mensalmente para que o leaderboard continue medindo a fronteira à medida que ela avança.
Curadoria e renovação de prompts
Mantemos uma rotação de prompts renovados regularmente para permanecer na fronteira de capacidades que evoluem rápido e para garantir a justiça e a precisão do nosso leaderboard.
- Taxonomia de prompts: cada prompt é escrito contra uma taxonomia de dois eixos, caso de uso real e capacidade do modelo, e etiquetado para ambos. Os prompts são amostrados uniformemente pela taxonomia na nossa arena.
- Dados de usuários reais: nossos prompts são escritos para refletir como os usuários finais realmente fazem prompts, informados por dados anonimizados de crowdsourcing e por um corpus de prompts curado por humanos e atualizado continuamente.
- Atualidade: renovamos nosso conjunto de prompts todo mês. Prompts são aposentados conforme sua capacidade de discriminar entre modelos e de refletir como usuários reais fazem prompts em modelos de imagem hoje.
Nosso conjunto de prompts carrega o sinal de dados de usuários reais e, ao mesmo tempo, oferece cobertura imparcial e uniforme de casos de uso e capacidades.
Taxonomia de prompts
Construímos nossa taxonomia de prompts ao longo de dois eixos.
Caso de uso. Estes casos de uso se baseiam na nossa análise de como consumidores e empresas estão adotando a geração de texto para imagem, e na nossa observação de casos de uso emergentes. Exemplos de tarefas para cada caso de uso:
- Marketing & Advertising: criativos de anúncio, visuais de campanha, pôsteres, imagens de marca
- Retail & E-commerce: fotos de produto, vestuário em modelo, mockups de embalagem
- Live-Action Film: cenas cinematográficas, stills de filme, storyboards, folhas de personagens
- Animation & Gaming: assets de jogos, concept art, design de personagens, quadrinhos
- Architecture & Real Estate: visualização interna e externa, plantas, staging
- Productivity & Knowledge Work: diagramas, infográficos, gráficos, slides
- UI/UX Design: mockups de UI para app, web, veicular e espacial
- Consumer: capas de livro, imagens de banco, ilustração editorial
- Social Media & Creator Content: thumbnails, cartões promocionais, artes de canal e perfil
- Frontier: capacidades na fronteira atual e além dela
Capacidade. Estas capacidades de modelo são informadas pelo nosso trabalho contínuo com os principais laboratórios e pelas capacidades que eles perseguem, e fundamentadas em benchmarks acadêmicos. Exemplos de cada capacidade:
- Reasoning: raciocínio sobre entidades, matemático, espacial e lógico, mistura de conceitos, interpretação de expressões idiomáticas
- Knowledge: marcos reais, espécies e fatos de domínio em ciência e senso comum
- Text Rendering: texto longo, texto pequeno, símbolos, lettering artístico
- Layout: fluxos, setas, blocos, hierarquia visual, composições multipainel
- Complex Compositions: contagem precisa, relações espaciais, interações entre sujeitos, associação de atributos
- Lighting: reflexão, refração, sombras, cáusticas
- Material: propriedades de superfície, transparência, espalhamento subsuperficial, realismo de texturas
- Physics: gravidade, apoio, colisão, mudanças térmicas e de estado
- Human Anatomy: mãos, rostos, proporção corporal, poses dinâmicas e movimento
Redação de prompts
Os prompts seguem padrões rígidos de escrita: linguagem natural simples, um único prompt positivo com o campo de prompt negativo vazio e formulação neutra quanto à arquitetura, que não favorece nenhuma família de modelos. Os prompts são triados por redundância no momento da escrita para garantir que cubram uma gama diversa de cenários reais de uso. Os prompts são escritos:
- Para cobertura completa da taxonomia, distribuídos uniformemente por cada combinação de caso de uso e capacidade. Como cada prompt carrega etiquetas de caso de uso, capacidade e estilo, podemos avaliar não só a qualidade geral do modelo, mas o desempenho nos recortes específicos que importam para cada usuário. Um usuário precisa do melhor modelo para design de UI com hierarquia complexa de layout; outro pode precisar de planos cinematográficos deslumbrantes com personagens humanos realistas.
- Para refletir como os usuários finais realmente fazem prompts, informados por prompts anonimizados de usuários reais coletados por crowdsourcing e por um corpus de padrões de prompts de consumidores curado por humanos e atualizado ao vivo.
Todos os prompts são:
- Em inglês
- Curados por humanos
O resultado são conjuntos de prompts de alto sinal e baixo ruído, que avaliam os modelos nas tarefas de geração mais relevantes para usuários finais e para a indústria, hoje e no futuro próximo.
Aposentadoria de prompts
Todo mês, selecionamos prompts para aposentar com base nestes dois critérios:
- Discriminação: se cada prompt ainda produz sinal claro sobre diferenças de capacidade entre modelos. Para cada voto, rotulamos o modelo mais bem classificado (pelo leaderboard global) como favorito. Prompts cuja taxa de vitória do favorito é estatisticamente indistinguível do acaso são marcados para aposentadoria.
- Atualidade/realismo: comparamos nosso conjunto de prompts de referência com nosso corpus vivo, incluindo nossos prompts colaborativos mais recentes e o corpus curado por humanos, para filtrar prompts que já não refletem as convenções reais de prompting.
Prompts aposentados deixam de ser servidos na arena para coleta de votos. A cadência mensal de renovação também protege a integridade do leaderboard: um conjunto de prompts que rotaciona não pode sofrer overfitting.
Metodologia de amostragem
Cada prompt do nosso conjunto é etiquetado com 1 caso de uso e 1 etiqueta de capacidade principal. Amostramos prompts uniformemente por cada combinação de caso de uso e capacidade.
Cada confronto emparelha duas saídas geradas do prompt idêntico, dentro da mesma modalidade. A posição esquerda/direita é aleatorizada e as identidades dos modelos só são reveladas após o voto. Modelos recém-adicionados são temporariamente sobreamostrados até seus ratings convergirem, e os oponentes são sorteados para maximizar o valor informativo de cada confronto. Cada caso de uso e capacidade contribui com peso igual para o rating geral do leaderboard.
Cálculo do Elo
Coleta de votos
A qualidade do modelo é medida por preferência humana.
- Votação cega em pares: avaliadores veem duas saídas geradas do mesmo prompt por dois modelos diferentes, sem identidades de modelo, e escolhem a que preferem.
- Dicas de julgamento: cada confronto mostra dicas curtas ligadas às etiquetas de caso de uso, capacidade e estilo do prompt, direcionando a atenção aos aspectos sob teste em prompts complexos.
- Tempo mínimo: votos só podem ser dados após um tempo mínimo de interação com cada saída.
- Qualidade do voto: todos os votos passam por detecção de bots e filtragem de anomalias antes de entrar no cálculo dos ratings.
Filtragem de votos
Filtramos votos de acordo com o que nossa metodologia atual mede. Votos anteriores à metodologia atual foram dados em prompts escritos para separar uma geração anterior de modelos. Modelos atuais saturam muitos desses prompts, com quase todos produzindo um resultado aceitável, de modo que um voto neles registra um cara ou coroa em vez de uma diferença de capacidade. Por isso aplicamos um filtro por coortes aos votos históricos:
- Coorte atual: modelos publicamente acessíveis, lançados recentemente e de maior relevância para nossa audiência. Classificados apenas com votos coletados sob a metodologia atual.
- Coorte legada: todos os outros modelos. Classificados com todos os votos em que aparecem, preservando sua representação no leaderboard.
- Regra: um voto é retido se e somente se ambos os modelos participantes forem elegíveis para ele.
Esse filtro é aplicado depois dos nossos filtros padrão de qualidade de voto, incluindo exclusão de bots e spam. O Elo é recalculado do zero sobre todo o conjunto de votos retido, com todos os modelos, coorte atual e legada igualmente, classificados nesse único cálculo. O rating é ancorado em FLUX.1 [schnell] = 1000 para o leaderboard geral e em FLUX.2 [dev] = 1000 para todos os leaderboards de subcategoria.
Metodologia de teste do tempo de geração
Principais detalhes técnicos:
- Frequência: os benchmarks são executados 4 vezes por dia, em horários aleatórios.
- Tamanho da amostra: o tempo de geração em destaque é a mediana das medições bem-sucedidas dos 14 dias anteriores, normalmente cerca de 56 amostras por modelo hospedado em cada janela.
- O que está incluído: cada medição cronometra o ciclo completo da solicitação de uma imagem, incluindo a solicitação à API, a inferência do provedor e o corpo da resposta em linha ou o download da URL para o disco. Quando os provedores retornam uma URL, ela costuma ser emitida antes que a imagem seja gravada por completo; por isso, o download dos bytes é contabilizado para refletir a latência real para o usuário final.
- Prompts exclusivos: a cada chamada, um novo prompt é gerado a partir de um conjunto selecionado, impedindo que os provedores retornem respostas em cache entre as execuções.
- Resolução: geramos em 1024×1024. Se a resolução mínima aceita por um modelo for superior a 1024×1024, usamos a menor resolução compatível que seja mais próxima de 1024×1024.
- Modo da API: usamos o endpoint síncrono do provedor quando disponível. Para provedores que oferecem apenas execução assíncrona, consultamos o status do trabalho a cada 100 milissegundos, para que a espera medida na fila reflita o tempo real do provedor, e não a granularidade das consultas.
- Agregação: a mediana, p05, p25, p75 e p95 são calculadas a partir da distribuição bruta das medições bem-sucedidas, sem remover valores atípicos.
- Recursos desativados do provedor: marcas d'água e verificações de segurança são desativadas quando a API permite, eliminando fontes de variação na latência que não estão relacionadas à velocidade de geração.
- O que não é medido: atraso de inicialização a frio do provedor, negociações de autenticação, sobrecarga de novas tentativas e aquecimento do cliente. Cada entrada no conjunto de dados corresponde a uma única medição isolada.
- Infraestrutura: execução no Google Cloud, na região us-central1.
- Novos endpoints: para endpoints recém-adicionados, inclusive aqueles avaliados antes da disponibilidade pública, podemos ajustar a frequência do benchmark para criar uma distribuição dos tempos de geração antes de listar os resultados. Os resultados publicados são calculados a partir dos 14 dias anteriores de medições. Portanto, os números dos endpoints recém-listados refletem as execuções iniciais e podem mudar à medida que novas medições forem acumuladas.
Critérios de inclusão de modelos e provedores
Nosso objetivo é analisar e comparar modelos populares e de alto desempenho para geração de imagens, ajudando os usuários a escolher entre eles. Por isso, aplicamos critérios de relevância para o setor e desempenho competitivo ao avaliar a inclusão de novos modelos e provedores. Aprimoramos esses critérios continuamente e aceitamos comentários ou sugestões. Para sugerir modelos ou provedores, entre em contato conosco pela página de contato.
Declaração de independência
Os benchmarks são conduzidos com independência e objetividade rigorosas. Não recebemos nenhuma compensação de provedores por sua inclusão na Artificial Analysis nem por resultados favoráveis.