Metodologia de benchmark de geração de imagens

Escopo e contexto

A Artificial Analysis realiza benchmarks de modelos de geração de imagens normalmente oferecidos por endpoints de API serverless. Esta página descreve a metodologia usada para medir a qualidade, a velocidade e o preço dos modelos de geração de imagens.

Para os recursos de geração de imagens, cobrimos duas modalidades:

  • Texto para imagem: modelos que geram uma imagem usando apenas um prompt de texto.
  • Edição de imagens: modelos que modificam uma imagem de referência com base em um prompt de texto.

Cobertura de endpoints

Cargas de trabalho cobertas: o benchmark de inferência abrange endpoints de geração de texto para imagem.

Apenas endpoints serverless públicos: o benchmark abrange endpoints realmente serverless que estão ou estarão disponíveis publicamente. Produtos de demonstração, apresentações de hardware e implantações dedicadas ou privadas não fazem parte do escopo.

Endpoints padrão e modificados

Classificamos cada endpoint como Padrão — que oferece o modelo nativo com total fidelidade e expõe seus parâmetros de entrada padrão — ou Modificado — que altera o modelo nativo de formas que afetam a fidelidade da saída, normalmente para aumentar a velocidade de geração ou reduzir o custo.

Os endpoints modificados recebem o rótulo Modificado na Artificial Analysis e podem ser ocultados na visualização padrão do ranking, permanecendo visíveis para os usuários que optarem por exibi-los. Para preservar a imparcialidade dos nossos benchmarks padrão, cabe a nós decidir se um endpoint será classificado como Modificado — os indicadores incluem destilação, exposição parcial dos parâmetros de entrada nativos do modelo ou redução significativa na qualidade da saída — e quantas variantes de um mesmo modelo serão listadas.

Configurações padrão de geração

Geramos imagens usando as configurações padrão publicadas de cada modelo. Para APIs próprias, isso significa as configurações padrão documentadas da API; para modelos de pesos abertos, as configurações padrão do repositório de código aberto. Isso inclui etapas de inferência, escala de orientação (guidance scale) e qualquer comportamento padrão de prompts negativos. Para possibilitar uma comparação justa entre os modelos, aplicamos as seguintes normalizações:

  • Geramos na maior resolução compatível com cada modelo e depois reduzimos para 1024×1024 para exibição em nossas Arenas.
  • Geramos 1 imagem por prompt.
  • Usamos uma proporção de 1:1.
  • Usamos uma semente de 42.

Nos modelos de edição de imagens, cada prompt é associado a uma imagem de referência de um conjunto selecionado.

Principais métricas

Usamos as métricas a seguir para acompanhar a qualidade, o desempenho e o preço dos modelos de geração de imagens.

Elo de qualidade

A pontuação Elo de cada modelo reflete sua qualidade relativa, derivada dos votos dos usuários na Image Arena. Calculamos as classificações usando a estimativa de máxima verossimilhança de Bradley-Terry e as redimensionamos para uma faixa semelhante ao Elo para facilitar a leitura.

Cada modalidade recebe uma pontuação independente, pois as disputas na Arena combinam apenas saídas da mesma modalidade.

Preço por 1.000 imagens

Preço do provedor (USD) por imagem gerada, multiplicado por 1.000.

O preço é obtido diretamente da tarifa por imagem publicada por cada provedor.

Tempo de geração

Mediana do tempo que o provedor leva para gerar uma única imagem, calculada nos últimos 14 dias.

As imagens são geradas com um tamanho de lote igual a 1. O tempo de geração inclui o download da imagem do provedor quando ele fornece uma URL em vez da imagem na resposta. Isso reflete a latência para o usuário final, pois as URLs podem ser disponibilizadas antes do término da geração.

Metodologia de teste do tempo de geração

Principais detalhes técnicos:

  • Frequência: os benchmarks são executados 4 vezes por dia, em horários aleatórios.
  • Tamanho da amostra: o tempo de geração em destaque é a mediana das medições bem-sucedidas dos 14 dias anteriores, normalmente cerca de 56 amostras por modelo hospedado em cada janela.
  • O que está incluído: cada medição cronometra o ciclo completo da solicitação de uma imagem, incluindo a solicitação à API, a inferência do provedor e o corpo da resposta em linha ou o download da URL para o disco. Quando os provedores retornam uma URL, ela costuma ser emitida antes que a imagem seja gravada por completo; por isso, o download dos bytes é contabilizado para refletir a latência real para o usuário final.
  • Prompts exclusivos: a cada chamada, um novo prompt é gerado a partir de um conjunto selecionado, impedindo que os provedores retornem respostas em cache entre as execuções.
  • Resolução: geramos em 1024×1024. Se a resolução mínima aceita por um modelo for superior a 1024×1024, usamos a menor resolução compatível que seja mais próxima de 1024×1024.
  • Modo da API: usamos o endpoint síncrono do provedor quando disponível. Para provedores que oferecem apenas execução assíncrona, consultamos o status do trabalho a cada 100 milissegundos, para que a espera medida na fila reflita o tempo real do provedor, e não a granularidade das consultas.
  • Agregação: a mediana, p05, p25, p75 e p95 são calculadas a partir da distribuição bruta das medições bem-sucedidas, sem remover valores atípicos.
  • Recursos desativados do provedor: marcas d'água e verificações de segurança são desativadas quando a API permite, eliminando fontes de variação na latência que não estão relacionadas à velocidade de geração.
  • O que não é medido: atraso de inicialização a frio do provedor, negociações de autenticação, sobrecarga de novas tentativas e aquecimento do cliente. Cada entrada no conjunto de dados corresponde a uma única medição isolada.
  • Infraestrutura: execução no Google Cloud, na região us-central1.
  • Novos endpoints: para endpoints recém-adicionados, inclusive aqueles avaliados antes da disponibilidade pública, podemos ajustar a frequência do benchmark para criar uma distribuição dos tempos de geração antes de listar os resultados. Os resultados publicados são calculados a partir dos 14 dias anteriores de medições. Portanto, os números dos endpoints recém-listados refletem as execuções iniciais e podem mudar à medida que novas medições forem acumuladas.

Critérios de inclusão de modelos e provedores

Nosso objetivo é analisar e comparar modelos populares e de alto desempenho para geração de imagens, ajudando os usuários a escolher entre eles. Por isso, aplicamos critérios de relevância para o setor e desempenho competitivo ao avaliar a inclusão de novos modelos e provedores. Aprimoramos esses critérios continuamente e aceitamos comentários ou sugestões. Para sugerir modelos ou provedores, entre em contato conosco pela página de contato.

Declaração de independência

Os benchmarks são conduzidos com independência e objetividade rigorosas. Não recebemos nenhuma compensação de provedores por sua inclusão na Artificial Analysis nem por resultados favoráveis.