Metodologia de benchmarking da Artificial Analysis

Escopo

A Artificial Analysis realiza benchmarks de inteligência, qualidade, desempenho e preço em modelos de IA, endpoints de APIs de inferência e sistemas. Esta seção do nosso site descreve nossa metodologia de benchmarking, incluindo nossos benchmarks de qualidade e de desempenho.

Em nossos benchmarks de modelos de linguagem, consideramos que os endpoints são serverless quando os clientes pagam apenas pelo uso, e não uma tarifa fixa para acessar um sistema. Em geral, isso significa que o preço dos endpoints é calculado por token, muitas vezes com preços diferentes para tokens de entrada e saída.

Em todas as modalidades, nossos benchmarks de desempenho medem o desempenho de ponta a ponta que os clientes de serviços e sistemas de inferência de IA vivenciam. Isso significa que os resultados dos benchmarks não pretendem representar o máximo desempenho possível em uma plataforma de hardware específica, mas sim o desempenho real que os clientes vivenciam entre diferentes provedores.

Avaliamos tanto modelos proprietários quanto modelos de pesos abertos.

Detalhes da metodologia

Definições

Nesta página e em todo o site da Artificial Analysis, usamos os seguintes termos:

  • Modelo: Um modelo de linguagem de grande escala (LLM), incluindo modelos proprietários, de código aberto e de pesos abertos.
  • Criador do modelo: A organização que desenvolveu e treinou o modelo. Por exemplo, a OpenAI é a criadora do GPT-4, e a Meta é a criadora do Llama 3.
  • Endpoint: Uma instância hospedada de um modelo que pode ser acessada por meio de uma API. Um único modelo pode ter vários endpoints de diferentes provedores.
  • Sistema: Um ambiente computacional dedicado à execução de modelos de IA, normalmente uma infraestrutura provisionada, como uma VM, cujo desempenho sob carga pode ser avaliado.
  • Provedor: Uma empresa que hospeda e fornece acesso a um ou mais endpoints de modelos ou sistemas. Alguns exemplos são OpenAI, AWS Bedrock, Together.ai, entre outros. Muitas empresas são, ao mesmo tempo, criadoras de modelos e provedoras.
  • Serverless: Serviço de nuvem fornecido conforme o uso. No contexto de APIs de inferência de LLMs, geralmente significa que o preço é calculado por token de entrada e saída. Mesmo assim, produtos de nuvem serverless são executados em servidores!
  • Pesos abertos: Um modelo cujos pesos foram disponibilizados publicamente por seu criador. Usamos 'pesos abertos' ou simplesmente modelos 'abertos', em vez de 'código aberto', pois muitos LLMs abertos foram disponibilizados sob licenças que não atendem à definição completa de software de código aberto.
  • Token: Os LLMs modernos são construídos com base em tokens — representações numéricas de palavras e caracteres. Os LLMs recebem tokens como entrada e geram tokens como saída. O texto de entrada é convertido em tokens por um tokenizador. Diferentes LLMs usam diferentes tokenizadores.
  • Tokens da OpenAI: Tokens gerados pelo tokenizador do GPT-3.5 e do GPT-4 da OpenAI, geralmente medidos nos benchmarks da Artificial Analysis com o pacote tiktoken da OpenAI para Python (tokenizador o200k_base). Usamos tokens da OpenAI como unidade de medida padrão em toda a Artificial Analysis para permitir comparações justas entre modelos. Todas as métricas de 'tokens por segundo' se referem a tokens da OpenAI.
  • Tokens nativos: Tokens gerados pelo tokenizador próprio de um LLM. Usamos 'tokens nativos' para diferenciá-los dos 'tokens da OpenAI'. Em geral, os preços se referem a tokens nativos.
  • Preço (entrada/saída): O preço cobrado por um provedor por token de entrada enviado ao modelo e por token de saída recebido do modelo. Os preços exibidos são os preços atuais informados pelos provedores.
  • Preço combinado: Para facilitar a comparação, calculamos um preço combinado considerando uma proporção de 7:2:1 entre tokens de acerto de cache, entrada e saída.
  • Custo por tarefa: O custo médio ponderado (USD) para concluir uma tarefa do Artificial Analysis Intelligence Index. Ele é calculado multiplicando os preços dos tokens de entrada, em cache e de saída pelos tokens consumidos em toda a carga de trabalho, ponderados pelos mesmos pesos por benchmark usados pelo Intelligence Index, e então dividindo pelo número de tarefas. O preço corresponde à tarifa da API própria do provedor ou à mediana entre todos os provedores. Os custos de cache variam conforme o provedor. Como o custo reflete o uso real de tokens, modelos que produzem respostas mais longas ou mais tokens de raciocínio têm um custo por tarefa maior, mesmo com preços idênticos por token.

    em que i = cada benchmark do Artificial Analysis Intelligence Index e w = o peso desse benchmark no Index

  • Tempo até o primeiro token: O tempo, em segundos, entre o envio de uma solicitação ao serviço ou sistema e o recebimento do primeiro token da resposta. Para modelos de raciocínio que retornam tokens de raciocínio, este será o primeiro token de raciocínio.
  • Tempo até o primeiro token da resposta final: O tempo, em segundos, entre o envio de uma solicitação ao serviço ou sistema e o recebimento do primeiro token da resposta final. Para modelos de raciocínio, isso é medido após qualquer tempo de 'reflexão'.
  • Velocidade de saída (tokens de saída por segundo): O número médio de tokens recebidos por segundo após o recebimento do primeiro token.
  • Tempo total de resposta para 100 tokens de saída: O número de segundos necessário para gerar 100 tokens de saída, calculado de forma sintética com base no TTFT e na velocidade de saída para maximizar a utilidade da comparação.
  • Tempo de resposta de ponta a ponta: O tempo total para receber uma resposta completa, incluindo o tempo de processamento da entrada, o tempo de raciocínio do modelo e o tempo de geração da resposta.
  • Média de tokens de raciocínio: Tempo que os modelos de raciocínio passam gerando tokens de 'raciocínio' antes de fornecer uma resposta. O cálculo se baseia no número médio de tokens de 'raciocínio' em um conjunto diversificado de 60 prompts. Quando a média de tokens de raciocínio não está disponível ou ainda não foi calculada, consideramos 2 mil tokens de raciocínio. Esses prompts têm tamanhos variados e abrangem diversos temas, incluindo consultas pessoais e comerciais, programação, matemática, ciências, entre outros. Os prompts combinam textos escritos pela Artificial Analysis e outros provenientes das seguintes avaliações: MMLU Pro, AIME 2025 e LiveCodeBench. Esses prompts podem ser acessados aqui.