Metodologia de benchmark de desempenho de APIs de modelos de linguagem da Artificial Analysis
Visão geral
Medir o desempenho de um LLM exige enviar um prompt a ele e medir as características de sua saída. Usamos diferentes cargas de trabalho de teste para avaliar e medir o desempenho dos LLMs.
Tipos de carga de trabalho
| Tipo de carga de trabalho | Descrição |
|---|---|
| 1k tokens de entrada | Aproximadamente 1.000 tokens de entrada e pelo menos 1.000 tokens de resposta |
| 10k tokens de entrada | Aproximadamente 10.000 tokens de entrada e pelo menos 1.500 tokens de resposta (benchmark padrão em nosso site) |
| 100k tokens de entrada | Aproximadamente 100.000 tokens de entrada e pelo menos 2.000 tokens de resposta |
| Carga de trabalho de visão | Uma única imagem de 1 megapixel, aproximadamente 1.000 tokens de entrada e 1.000 tokens de saída |
Prompts mais longos podem resultar em um tempo maior até o primeiro token e em menos tokens de saída por segundo do que prompts mais curtos.
Cenários de carga
| Cenário de carga | Descrição |
|---|---|
| Prompt único | Um prompt é enviado por vez à API do modelo |
| Prompts paralelos | 10 prompts são enviados simultaneamente à API do modelo |
Frequência dos testes
- Nossas cargas de trabalho de visão e de 1k e 10k tokens de entrada são testadas 8 vezes por dia, aproximadamente a cada 3 horas
- No teste com cargas de trabalho múltiplas ou paralelas, enviamos 10 solicitações simultâneas da nossa carga de trabalho padrão de 1k tokens de entrada uma vez por dia, em um horário aleatório
- Nossa carga de trabalho de 100k tokens de entrada é testada uma vez por semana
Geração de prompts
Cada execução de teste usa um prompt exclusivo, gerado no momento do teste e executado em todos os endpoints que cobrimos. Os prompts combinam diferentes conteúdos de entrada longos (por exemplo, artigos) com diferentes tarefas, incluindo explicação ou resumo, geração de perguntas e respostas, análise comparativa, tradução ou geração de artefatos visuais.
Os parâmetros do processo de geração são definidos para preencher o orçamento de tokens desejado, produzindo saídas variadas que testam diferentes capacidades de raciocínio e geração.
A diversidade dos prompts é importante para o benchmark de desempenho porque técnicas como a decodificação especulativa geram variações na velocidade de saída conforme o tipo de conteúdo produzido.
Representação das medições
As medições de desempenho são representadas pela mediana (P50) das últimas 72 horas para refletir mudanças persistentes no desempenho que os usuários podem esperar ao usar a API. A exceção é a carga de trabalho com prompts de 100k tokens, testada uma vez por semana e representada pela mediana (P50) dos últimos 14 dias.
Principais definições
- Tempo até o primeiro token: O tempo, em segundos, entre o envio de uma solicitação ao serviço ou sistema e o recebimento do primeiro token da resposta. Para modelos de raciocínio que retornam tokens de raciocínio, este será o primeiro token de raciocínio.
- Tempo até o primeiro token da resposta final: O tempo, em segundos, entre o envio de uma solicitação ao serviço ou sistema e o recebimento do primeiro token da resposta final. Para modelos de raciocínio, isso é medido após qualquer tempo de 'reflexão'.
- Velocidade de saída (tokens de saída por segundo): O número médio de tokens recebidos por segundo após o recebimento do primeiro token.
- Tempo total de resposta para 100 tokens de saída: O número de segundos necessário para gerar 100 tokens de saída, calculado de forma sintética com base no TTFT e na velocidade de saída para maximizar a utilidade da comparação.
- Tempo de resposta de ponta a ponta: O tempo total para receber uma resposta completa, incluindo o tempo de processamento da entrada, o tempo de raciocínio do modelo e o tempo de geração da resposta.
- Média de tokens de raciocínio: Tempo que os modelos de raciocínio passam gerando tokens de 'raciocínio' antes de fornecer uma resposta. O cálculo se baseia no número médio de tokens de 'raciocínio' em um conjunto diversificado de 60 prompts. Quando a média de tokens de raciocínio não está disponível ou ainda não foi calculada, consideramos 2 mil tokens de raciocínio. Esses prompts têm tamanhos variados e abrangem diversos temas, incluindo consultas pessoais e comerciais, programação, matemática, ciências, entre outros. Os prompts combinam textos escritos pela Artificial Analysis e outros provenientes das seguintes avaliações: MMLU Pro, AIME 2025 e LiveCodeBench. Esses prompts podem ser acessados aqui.
Detalhes técnicos
Localização do servidor: nosso servidor principal de testes é uma máquina virtual hospedada na zona us-central1-a do Google Cloud.
Contas de teste: realizamos os testes com uma combinação de contas anônimas, contas com créditos e chaves de API fornecidas expressamente para benchmarks. Quando nosso benchmark principal não é realizado com uma conta anônima, criamos uma conta anônima separada e verificamos se o desempenho não está sendo manipulado.
Bibliotecas de API: para todos os provedores que declaram compatibilidade com a API da OpenAI, usamos a biblioteca Python oficial da OpenAI para garantir a consistência entre os testes. Para provedores sem compatibilidade com a OpenAI, usamos as bibliotecas cliente recomendadas por eles.
Parâmetros da API: usamos os seguintes parâmetros de API em todos os testes:
temperature: 0.6para modelos de raciocínio;temperature: 0para modelos sem raciocínio, salvo indicação diferente do criador do modelo.top_p: 1
Medição de tokens: temos dois métodos para medir tokens:
- No benchmark de desempenho, medimos os tokens conforme a contagem da biblioteca tiktoken da OpenAI (
o200k_base). Isso padroniza o número de tokens contabilizados em diferentes modelos (com diferentes tokenizadores), para que o mesmo texto seja representado pelo mesmo número de tokens. - Nas avaliações do Artificial Analysis Intelligence Index, por outro lado, usamos as contagens de tokens informadas pelo provedor da API de cada modelo (incluindo tokens de entrada em cache, de raciocínio e de saída), o que nos permite informar com maior precisão o custo de execução do Intelligence Index. Ao informar as taxas de acerto do cache e o custo, combinamos essas contagens com medições em tempo real da taxa de acerto típica do cache de cada modelo, em vez de depender da medição pontual feita durante a avaliação.
Cálculo da velocidade de saída: nos modelos de raciocínio que não expõem todos os tokens de raciocínio na resposta, calculamos a velocidade de saída usando os 80% finais dos trechos da resposta. Isso garante que as velocidades de saída medidas sejam consistentes e reflitam melhor a experiência do usuário.
Limitações conhecidas
Eficiência do tokenizador e preços: diferentes modelos usam diferentes tokenizadores, o que pode gerar diferenças no número de tokens necessário para representar o mesmo texto. Isso significa que os preços nem sempre são diretamente comparáveis entre modelos. Estamos preparando mais detalhes sobre a eficiência dos tokenizadores e seu impacto nos preços. Enquanto isso, compartilhamos no Twitter uma análise preliminar de preços ajustados pela eficiência do tokenizador.
Quantização: alguns modelos usam técnicas de quantização para reduzir os requisitos computacionais e aumentar a velocidade. No entanto, a quantização também pode afetar a qualidade do modelo. Estamos avançando rumo à divulgação completa dos métodos de quantização usados pelos modelos incluídos em nossos benchmarks.
Localização do servidor e TTFT: o tempo até o primeiro token (TTFT) é sensível à localização do servidor, pois inclui a latência da rede. Nosso servidor principal de testes fica na zona us-central1-a do Google Cloud, o que pode favorecer ou prejudicar determinados provedores conforme a localização dos servidores deles. Estamos considerando adicionar outros locais de teste para atenuar esse efeito.
Histórico de versões
Versão 2.2.0
2 de março de 2026
- Prompts atualizados: introduzimos um conjunto aprimorado de prompts com conteúdo mais abrangente e variado, incluindo mais tipos de tarefas. Isso é importante porque técnicas como a decodificação especulativa geram variações na velocidade de saída conforme o tipo de conteúdo produzido.
- Mudança na carga de trabalho padrão: a velocidade padrão exibida em nosso site agora reflete os resultados de prompts com 10k tokens de entrada (antes, 1k), e descontinuamos as medições de desempenho para cargas de trabalho de 100 tokens de entrada. Todas as cargas de trabalho de 1k, 10k e 100k tokens de entrada continuam visíveis em todas as páginas ao selecionar o menu suspenso Opções de prompt. A forma mais simples de comparar velocidades de saída para diferentes formatos de carga de trabalho é usar o gráfico Velocidade de saída por número de tokens de entrada.
Termos de integridade
Contexto
A Artificial Analysis é uma provedora independente de benchmarks e análises de IA. Nossos benchmarks são amplamente citados e consultados por milhões de usuários e organizações.
Trabalhamos para garantir que todos os dados publicados na Artificial Analysis sejam justos, transparentes e representativos da experiência típica dos desenvolvedores e organizações que usam os modelos e endpoints que cobrimos. Nossos dados de benchmark de inferência são amplamente usados como referência para comparar provedores de inferência em dimensões como velocidade, latência e qualidade. O valor dessas medições depende de elas refletirem a experiência de um desenvolvedor comum usando o endpoint padrão e publicamente disponível de um provedor.
Estes termos formalizam a abordagem adotada pela Artificial Analysis desde que começamos a avaliar o desempenho de inferência. Eles se aplicam igualmente a todos os provedores e plataformas de inferência (em conjunto, "provedores") que publicam dados de endpoints serverless na Artificial Analysis e garantem que todos os provedores sejam medidos com os mesmos critérios justos.
Requisitos para provedores
O tráfego da Artificial Analysis deve ser atendido pela mesma configuração publicamente disponível que qualquer desenvolvedor comum receberia ao usar o endpoint. Em particular, os provedores não podem:
- Detectar, identificar por impressão digital ou reconhecer de qualquer outra forma o tráfego da Artificial Analysis (seja por conta, chave de API, endereço IP, cabeçalhos de solicitação, payloads ou padrões de tráfego) e tratá-lo de modo diferente do tráfego comum.
- Direcionar o tráfego da Artificial Analysis a recursos dedicados, reservados ou não públicos, incluindo hardware separado, pools de capacidade, filas prioritárias ou regiões geográficas que não estejam disponíveis de forma geral.
- Fornecer à Artificial Analysis um modelo, uma quantização, um tamanho de contexto ou uma configuração de endpoint diferente do que é anunciado publicamente e está disponível de forma geral sob o mesmo nome.
- Atender o tráfego da Artificial Analysis com um tamanho de lote, uma simultaneidade ou uma configuração de carga que não represente o que o tráfego comum recebe no mesmo endpoint (por exemplo, executar solicitações de benchmark com lotes menores para aumentar a velocidade de cada solicitação).
Quando solicitado, o provedor deve confirmar a versão do modelo, a precisão ou quantização e o tamanho de contexto que atendem o tráfego da Artificial Analysis, além de confirmar que correspondem à oferta pública padrão. Os provedores devem garantir que todo funcionário, prestador de serviços, consultor ou afiliado ciente de que um endpoint está sendo medido pela Artificial Analysis cumpra esta política.
Recursos de desempenho que fazem parte da oferta pública padrão e estão disponíveis a todos os desenvolvedores em condições equivalentes (por exemplo, escalonamento automático, cache disponível de forma geral ou níveis de serviço publicados e acessíveis a qualquer cliente) não constituem violação, desde que não sejam aplicados de forma seletiva ao tráfego da Artificial Analysis.
Processo de conformidade
A Artificial Analysis lista endpoints e provedores a seu exclusivo critério. Reservamo-nos o direito de retirar da lista qualquer endpoint ou provedor que não cumpra estes termos e de recusar, reter ou remover qualquer listagem por qualquer motivo.
Realizamos verificações frequentes de consistência em todos os endpoints que medimos. Como prática padrão, fazemos medições com nossa conta principal da Artificial Analysis e com contas de teste independentes, cada uma criada e usada da mesma forma que a conta de um desenvolvedor comum. Quando essas contas retornam resultados materialmente diferentes para payloads idênticos no mesmo endpoint, investigamos antes de tirar conclusões.
Se detectarmos ou suspeitarmos, com motivos razoáveis, que o tráfego da Artificial Analysis está sendo atendido de forma diferente da oferta pública padrão, poderemos:
- Reter, remover ou adiar a publicação das medições afetadas.
- Realizar novas medições em uma conta padrão criada publicamente e publicar esses resultados.
- Remover o endpoint ou provedor dos rankings e listagens de desempenho.
- Suspender o provedor de todos os rankings.
- Divulgar publicamente que um provedor forneceu à Artificial Analysis um desempenho não representativo.
Ao enviar endpoints à Artificial Analysis, os provedores reconhecem estes termos e nosso compromisso comum com a integridade dos benchmarks. A Artificial Analysis pode atualizar esta política a qualquer momento.
Agradecemos a colaboração para preservar a integridade dos nossos benchmarks. Em caso de dúvidas ou preocupações, entre em contato com nossa equipe.