Metodología del Índice de precisión de endpoints v1.0
Índice de precisión de endpoints v1.0
El Índice de precisión de endpoints mide cómo varían la inteligencia y la capacidad de un modelo concreto entre distintos proveedores de API que lo sirven. El mismo modelo servido por distintos proveedores puede comportarse de forma diferente según la cuantización, los valores predeterminados de muestreo, el manejo de contexto, los límites de tokens, los parsers de prompts y otra configuración del lado del endpoint. Para capturarlo, volvemos a ejecutar una suite fija de evaluaciones contra cada endpoint de proveedor e informamos qué tan cerca reproduce el endpoint la precisión del modelo.
También usamos un despliegue autohospedado del modelo como línea base, expresando la puntuación de precisión general de cada endpoint de proveedor como porcentaje del despliegue de referencia. El índice está diseñado para que 100% signifique que un endpoint coincide con la referencia, y puntuaciones más bajas indiquen que la precisión es menor respecto a la línea base.
Mostramos la significancia estadística de cada resultado. Cada resultado de endpoint incluye un intervalo de confianza del 95% calculado a partir de la variación entre repeticiones, e indicamos si el resultado del endpoint es estadísticamente indistinguible de la referencia o significativamente inferior a ella. También informamos una nota para cada endpoint que presentó ciertas características o deficiencias que afectaron el resultado.
Los resultados son capturas en un momento dado, no monitoreo en vivo. Cada resultado está fechado e informa el número de repeticiones usadas, para interpretarlo en contexto.
Suite de evaluación
Cada endpoint se evalúa con una suite fija de tres evaluaciones que abarcan uso nativo de herramientas, razonamiento difícil y recuperación de contexto largo. El número de repeticiones se elige por evaluación para mantener intervalos de confianza estrechos, y esa cantidad se muestra junto a cada resultado.
Suite del Índice de precisión de endpoints v1.0. Las variantes más antiguas, completas y experimentales no forman parte de la suite.
| Evaluación | Campo | Subconjunto | Repeticiones | Peso | Puntuación |
|---|---|---|---|---|---|
| BFCL v4-500 | Llamadas a herramientas / funciones | Subconjunto de 500 tareas del Berkeley Function Calling Leaderboard | 3 | 33% | Ejecución y coincidencia nativa de llamadas a herramientas, precisión media entre repeticiones |
| HLE-250 | Razonamiento difícil | Subconjunto de 250 preguntas de Humanity's Last Exam | 10 | 33% | LLM de comprobación de igualdad, precisión media entre repeticiones |
| AA-LCR-25 | Recuperación de contexto largo | Subconjunto de 25 preguntas de Artificial Analysis Long Context Reasoning | 10 | 33% | LLM de comprobación de igualdad, precisión media entre repeticiones |
Conjuntos de evaluación
BFCL v4-500: Llamadas a herramientas / funciones
- Qué mide: BFCL (Berkeley Function Calling Leaderboard) evalúa con qué fiabilidad un modelo usa llamadas nativas a herramientas / funciones, en llamadas simples, paralelas, múltiples y multiturno, además de detección de irrelevancia (saber cuándo no llamar a una herramienta). Ejecutamos un subconjunto solo offline de 500 tareas que sobrepondera las partes más desafiantes de la evaluación, como las categorías multiturno y paralelas. Las categorías saturadas, intensivas en recursos o menos discriminativas (Java/JS, memoria, búsqueda web, relevancia en vivo) se excluyen del subconjunto BFCL v4-500. Usamos la versión 2026.3.23.
- Subconjunto y repeticiones: Subconjunto de 500 tareas del Berkeley Function Calling Leaderboard, ejecutado con 3 repeticiones.
- Puntuación: Ejecución y coincidencia nativa de llamadas a herramientas, precisión media entre repeticiones.
- Referencia: https://gorilla.cs.berkeley.edu/leaderboard.html
- Por qué algunos endpoints podrían fallar: Límites de herramientas, análisis del esquema de herramientas y formato de retorno, limitaciones de contexto.
HLE-250: Razonamiento difícil
- Qué mide: Humanity's Last Exam (HLE) es un benchmark académico de frontera con preguntas difíciles escritas por expertos en matemáticas, ciencias naturales y humanidades. Ejecutamos un subconjunto solo de texto de 250 preguntas que sobrepondera las preguntas más difíciles y desafiantes del conjunto completo. La versión completa se ejecuta como parte del Artificial Analysis Intelligence Index.
- Subconjunto y repeticiones: Subconjunto de 250 preguntas de Humanity's Last Exam, ejecutado con 10 repeticiones.
- Puntuación: LLM de comprobación de igualdad, precisión media entre repeticiones.
- Referencia: https://huggingface.co/datasets/cais/hle
- Por qué algunos endpoints podrían fallar: Límites/truncamiento de tokens de contexto y de salida, limitaciones del esfuerzo de razonamiento, cuantización y precisión de inferencia.
AA-LCR-25: Recuperación de contexto largo
- Qué mide: AA-LCR (Artificial Analysis Long Context Reasoning) prueba el razonamiento a través de múltiples documentos largos (alrededor de 100k tokens de entrada por pregunta). Ejecutamos un subconjunto de 25 preguntas que sobrepondera las preguntas más difíciles y desafiantes del conjunto completo. La versión completa se ejecuta como parte del Artificial Analysis Intelligence Index.
- Subconjunto y repeticiones: Subconjunto de 25 preguntas de Artificial Analysis Long Context Reasoning, ejecutado con 10 repeticiones.
- Puntuación: LLM de comprobación de igualdad, precisión media entre repeticiones.
- Por qué algunos endpoints podrían fallar: Límites de ventana de contexto, truncamiento de entrada, respuestas vacías.
Puntuación
Cada evaluación produce una precisión media entre sus repeticiones. El Índice de precisión de endpoints compuesto es la combinación ponderada de las tres puntuaciones de evaluación, normalizada a una escala de 0 a 100:
La precisión media de cada evaluación (0 a 1) se multiplica por su peso y se divide por el peso total. Las tres evaluaciones tienen el mismo peso (33% / 33% / 33%). El compuesto solo se calcula cuando las tres evaluaciones tienen un resultado de la versión actual para el endpoint.
Cuando existe un endpoint de referencia autohospedado, las puntuaciones se expresan como porcentaje de esa referencia, tanto por evaluación como a nivel compuesto, usando la misma combinación ponderada sobre las proporciones por evaluación:
La puntuación de cada endpoint se muestra como porcentaje de la referencia, con un intervalo de confianza del 95% que combina su propia incertidumbre con la de la referencia. Construimos ese intervalo a partir de la variación entre repeticiones con una prueba t de Student bilateral al 95%, combinamos las tres evaluaciones en cuadratura y comparamos el resultado con la referencia (100%):
- Dentro del rango: el intervalo de confianza incluye el valor de referencia — el resultado no se distingue estadísticamente de ella.
- Significativamente fuera del rango: el intervalo de confianza queda por completo fuera de la referencia — una diferencia estadísticamente significativa.
La puntuación exacta y el intervalo de confianza de cada endpoint se muestran en el gráfico.
Las puntuaciones brutas de 0 a 1 se conservan en la capa de datos y solo se multiplican por 100 para mostrarlas. Para cada endpoint usamos la ejecución más reciente por evaluación; cuando hay varias, preferimos la más reciente y, en la misma fecha, la que tenga menos tareas con error.
Parámetros de inferencia
Los endpoints se evalúan con ajustes estandarizados para que las diferencias reflejen el endpoint, no el harness:
- Muestreo: se aplican de forma consistente valores predeterminados de muestreo estandarizados entre endpoints: la temperatura recomendada por el laboratorio del modelo cuando se especifica; de lo contrario, 0.6 para modelos de razonamiento, en línea con nuestro enfoque para el Artificial Analysis Intelligence Index.
- Razonamiento: se usa el modo de razonamiento más alto que soporte el endpoint.
- Llamadas a herramientas: se usan los valores predeterminados de la API, con la elección de herramienta en auto y adherencia estricta al esquema habilitada. Cuando un endpoint no soporta alguno de estos, usamos el ajuste compatible más cercano para ese endpoint.
- Streaming: nuestra línea base es con streaming habilitado. Los endpoints que no soportan streaming se ejecutan con streaming deshabilitado.
- Salida y contexto: se usan el máximo de tokens de salida y la ventana de contexto que soporte el endpoint.
Ejecuciones de referencia y reproducibilidad
La ejecución de referencia de cada modelo es un despliegue autohospedado del modelo, normalmente con vLLM o SGLang. Configuramos el servidor con los ajustes recomendados por el laboratorio del modelo y por el framework de inferencia (p. ej. usando las recetas de vLLM o las recetas de SGLang), servido con los ajustes de precisión más altos recomendados para la inferencia del modelo. Los detalles clave de configuración (como el framework de inferencia y las versiones de CUDA, la información de los pesos del modelo y los argumentos de arranque) se registran y se muestran junto al resultado, visibles en el elemento de notas del resultado de la ejecución de referencia y abajo.
La suite de evaluación está fijada a versiones concretas para que los resultados sean comparables en el tiempo y entre endpoints.
GLM-5.2
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13 (Docker image: lmsysorg/sglang:latest)
- CUDA: 13.0
- Precision: native FP8 with DeepGEMM kernels
- Model weights: zai-org/GLM-5.2-FP8 on Hugging Face
Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: glm45
- tool-call-parser: glm47gpt-oss-120b
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13.post1 (Docker image: lmsysorg/sglang:v0.5.13.post1)
- CUDA: 13.0
- Precision: native MXFP4 (FlashInfer MXFP4 MoE kernels) + BF16 attention/dense
- Model weights: openai/gpt-oss-120b on Hugging Face
Key SGLang launch args:
- kv-cache-dtype: bfloat16
- reasoning-parser: gpt-oss
- tool-call-parser: gpt-ossResultados en un momento dado
Los resultados de precisión de endpoints son capturas fechadas, no monitoreo en vivo. Los endpoints pueden cambiar con el tiempo a medida que los proveedores actualizan su stack de inferencia y la configuración del endpoint, por lo que cada resultado lleva la fecha en que se midió.
Selección de modelos
Priorizamos modelos para el benchmarking de precisión de endpoints cuando hay un ecosistema amplio de proveedores que sirven el mismo modelo (con mayor frecuencia modelos de pesos abiertos servidos por muchos proveedores de inferencia) y cuando el modelo se usa ampliamente en producción. El conjunto de modelos incluidos es una mezcla rotativa que cambia con el tiempo a medida que se agregan nuevos modelos y proveedores, así que no es fijo.
Los modelos con cobertura actual del Índice de precisión de endpoints son: