Metodologia do Índice de acurácia de endpoints v1.0

Índice de acurácia de endpoints v1.0

O Índice de acurácia de endpoints mede como a inteligência e a capacidade de um modelo específico variam entre os diferentes provedores de API que o disponibilizam. O mesmo modelo disponibilizado por provedores distintos pode apresentar comportamentos diferentes conforme a quantização, os padrões de amostragem, o tratamento do contexto, os limites de tokens, os interpretadores de prompts e outras configurações do endpoint. Para avaliar isso, executamos novamente um conjunto fixo de avaliações em cada endpoint de provedor e informamos com que fidelidade o endpoint reproduz a acurácia do modelo.

Também usamos uma implantação auto-hospedada do modelo como referência e expressamos a pontuação geral de acurácia de cada endpoint de provedor como uma porcentagem dessa implantação. O índice foi projetado para que 100% indique que um endpoint corresponde à referência, enquanto pontuações menores indicam acurácia inferior à referência.

Exibimos a significância estatística de cada resultado. Cada resultado de endpoint apresenta um intervalo de confiança de 95% calculado a partir da variação entre as repetições e indicamos se o endpoint está estatisticamente dentro da referência ou significativamente abaixo dela. Também mostramos uma observação para cada endpoint que apresentou determinadas características ou limitações que afetaram o resultado.

Os resultados são retratos de um determinado momento, não um monitoramento em tempo real. Cada resultado informa a data e o número de repetições usadas, permitindo interpretá-lo em seu contexto.

Conjunto de avaliações

Cada endpoint passa por um conjunto fixo de três avaliações que abrangem uso nativo de ferramentas, raciocínio avançado e recuperação em contexto longo. O número de repetições é escolhido para cada avaliação a fim de manter intervalos de confiança estreitos e é exibido junto ao respectivo resultado.

Conjunto do Índice de acurácia de endpoints v1.0. Variantes anteriores, completas e experimentais não fazem parte dele.

AvaliaçãoÁreaSubconjuntoRepetiçõesPesoPontuação
BFCL v4-500Chamada de ferramentas/funçõesSubconjunto de 500 tarefas do Berkeley Function Calling Leaderboard333%Execução e correspondência de chamadas nativas de ferramentas, acurácia média entre as repetições
HLE-250Raciocínio avançadoSubconjunto de 250 perguntas do Humanity's Last Exam1033%LLM verificador de igualdade, acurácia média entre as repetições
AA-LCR-25Recuperação em contexto longoSubconjunto de 25 perguntas do Artificial Analysis Long Context Reasoning1033%LLM verificador de igualdade, acurácia média entre as repetições

Conjuntos de dados das avaliações

BFCL v4-500: Chamada de ferramentas/funções

  • O que mede: O BFCL (Berkeley Function Calling Leaderboard) avalia a confiabilidade com que um modelo usa chamadas nativas de ferramentas/funções em chamadas simples, paralelas, múltiplas e com vários turnos, além da detecção de irrelevância (saber quando não chamar uma ferramenta). Executamos um subconjunto exclusivamente offline de 500 tarefas, com maior peso para as partes mais desafiadoras da avaliação, como as categorias de vários turnos e paralelas. Categorias saturadas, que consomem muitos recursos ou que fazem menos distinção entre os modelos (Java/JS, memória, pesquisa na web e relevância em tempo real) não fazem parte do subconjunto BFCL v4-500. Usamos a versão 2026.3.23.
  • Subconjunto e repetições: Subconjunto de 500 tarefas do Berkeley Function Calling Leaderboard, executado com 3 repetições.
  • Pontuação: Execução e correspondência de chamadas nativas de ferramentas, acurácia média entre as repetições.
  • Referência: https://gorilla.cs.berkeley.edu/leaderboard.html
  • Por que alguns endpoints podem falhar: Limites de ferramentas, interpretação do esquema das ferramentas e formatação do retorno, limitações de contexto.

HLE-250: Raciocínio avançado

  • O que mede: O Humanity's Last Exam (HLE) é um benchmark acadêmico de fronteira com perguntas difíceis, elaboradas por especialistas, que abrangem matemática, ciências naturais e ciências humanas. Executamos um subconjunto somente de texto com 250 perguntas, atribuindo maior peso às perguntas mais difíceis e desafiadoras do conjunto completo. A versão completa é executada como parte do Artificial Analysis Intelligence Index.
  • Subconjunto e repetições: Subconjunto de 250 perguntas do Humanity's Last Exam, executado com 10 repetições.
  • Pontuação: LLM verificador de igualdade, acurácia média entre as repetições.
  • Referência: https://huggingface.co/datasets/cais/hle
  • Por que alguns endpoints podem falhar: Limites ou truncamento de tokens de contexto e saída, limitações do esforço de raciocínio, quantização e precisão da inferência.

AA-LCR-25: Recuperação em contexto longo

  • O que mede: O AA-LCR (Artificial Analysis Long Context Reasoning) testa o raciocínio em vários documentos longos (cerca de 100 mil tokens de entrada por pergunta). Executamos um subconjunto de 25 perguntas, atribuindo maior peso às perguntas mais difíceis e desafiadoras do conjunto completo. A versão completa é executada como parte do Artificial Analysis Intelligence Index.
  • Subconjunto e repetições: Subconjunto de 25 perguntas do Artificial Analysis Long Context Reasoning, executado com 10 repetições.
  • Pontuação: LLM verificador de igualdade, acurácia média entre as repetições.
  • Por que alguns endpoints podem falhar: Limites da janela de contexto, truncamento da entrada, respostas vazias.

Pontuação

Cada avaliação produz uma acurácia média entre suas repetições. O Índice de acurácia de endpoints composto é a combinação ponderada das pontuações das três avaliações, normalizada em uma escala de 0 a 100:

A acurácia média de cada avaliação (de 0 a 1) é multiplicada por seu peso e dividida pelo peso total. As três avaliações têm o mesmo peso (33% / 33% / 33%). A pontuação composta só é calculada quando todas as três avaliações têm um resultado da versão atual para o endpoint.

Quando existe um endpoint de referência auto-hospedado, as pontuações são expressas como porcentagem dessa referência, tanto por avaliação quanto no nível composto, usando a mesma combinação ponderada das proporções de cada avaliação:

A pontuação de cada endpoint é exibida como porcentagem da referência, com um intervalo de confiança de 95% que combina sua própria incerteza com a da referência. Construímos esse intervalo com base na variação entre as repetições usando um teste t de Student bilateral de 95%, combinamos as três avaliações em quadratura e comparamos o resultado com a referência (100%):

  • Dentro do intervalo: o intervalo de confiança inclui a referência — não há diferença estatisticamente significativa.
  • Significativamente fora do intervalo: o intervalo de confiança está inteiramente fora da referência — uma diferença estatisticamente significativa.

A pontuação exata e o intervalo de confiança de cada endpoint são exibidos no gráfico.

As pontuações brutas de 0 a 1 são mantidas na camada de dados e multiplicadas por 100 apenas para exibição. Para cada endpoint, usamos a execução mais recente de cada avaliação; quando há várias execuções, damos preferência à mais recente e, na mesma data, àquela com menos tarefas com erro.

Parâmetros de inferência

Os endpoints são avaliados com configurações padronizadas para que as diferenças reflitam o endpoint, não o sistema de avaliação:

  • Amostragem: os padrões de amostragem são aplicados de modo uniforme a todos os endpoints: usamos a temperatura recomendada pelo laboratório do modelo, quando especificada; caso contrário, usamos 0,6 para modelos de raciocínio, de acordo com nossa abordagem para o Artificial Analysis Intelligence Index.
  • Raciocínio: usamos o modo de raciocínio mais alto oferecido pelo endpoint.
  • Chamada de ferramentas: usamos os padrões da API, com a escolha da ferramenta definida como auto e a adesão estrita ao esquema ativada. Quando um endpoint não oferece uma dessas opções, usamos a configuração compatível mais próxima para esse endpoint.
  • Streaming: nossa referência usa o streaming ativado. Os endpoints que não permitem streaming são executados com esse recurso desativado.
  • Saída e contexto: usamos o número máximo de tokens de saída e a janela de contexto permitidos pelo endpoint.

Execuções de referência e reprodutibilidade

A execução de referência de cada modelo é uma implantação auto-hospedada, normalmente com vLLM ou SGLang. Configuramos o servidor com as opções recomendadas pelo laboratório do modelo e pelo framework de serviço (por exemplo, usando as receitas do vLLM ou o guia do SGLang) e adotamos as configurações de precisão mais altas recomendadas para a inferência do modelo. Os principais detalhes de configuração (como versões do framework de serviço e do CUDA, informações sobre os pesos do modelo e argumentos de inicialização) são registrados e exibidos junto ao resultado, tanto no elemento de observações do resultado de referência quanto abaixo.

O conjunto de avaliações usa versões fixas para que os resultados sejam comparáveis ao longo do tempo e entre endpoints.

DeepSeek V4 Pro

Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.12 (Docker image: lmsysorg/sglang:deepseek-v4-blackwell)
- CUDA: 13.0
- Precision: native — W4A8 MoE experts (MegaMoE) + FP8 (e4m3) attention/dense
- Model weights: deepseek-ai/DeepSeek-V4-Pro on Hugging Face

Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: deepseek-v4
- tool-call-parser: deepseekv4

GLM-5.2

Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13 (Docker image: lmsysorg/sglang:latest)
- CUDA: 13.0
- Precision: native FP8 with DeepGEMM kernels
- Model weights: zai-org/GLM-5.2-FP8 on Hugging Face

Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: glm45
- tool-call-parser: glm47

gpt-oss-120b

Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13.post1 (Docker image: lmsysorg/sglang:v0.5.13.post1)
- CUDA: 13.0
- Precision: native MXFP4 (FlashInfer MXFP4 MoE kernels) + BF16 attention/dense
- Model weights: openai/gpt-oss-120b on Hugging Face

Key SGLang launch args:
- kv-cache-dtype: bfloat16
- reasoning-parser: gpt-oss
- tool-call-parser: gpt-oss

Resultados em um determinado momento

Os resultados de acurácia dos endpoints são retratos datados, não um monitoramento em tempo real. Os endpoints podem mudar conforme os provedores atualizam sua infraestrutura de serviço e suas configurações. Por isso, cada resultado informa a data da medição. As novas execuções ocorrem em uma frequência definida e a pedido do provedor; sempre exibimos o resultado e a data mais recentes.

Seleção de modelos

Priorizamos o benchmarking da acurácia de endpoints para modelos que contam com um amplo ecossistema de provedores oferecendo o mesmo modelo — geralmente modelos de pesos abertos disponibilizados por vários provedores de inferência — e são amplamente usados em produção. O conjunto de modelos incluídos é rotativo e muda à medida que novos modelos e provedores são adicionados, portanto não é fixo.

Os modelos atualmente cobertos pelo Índice de acurácia de endpoints são: