Metodología de benchmarking de rendimiento de APIs de modelos de lenguaje de Artificial Analysis
Resumen
Medir el rendimiento de un LLM requiere enviarle un prompt y medir las características de su salida. Usamos una variedad de cargas de prueba para evaluar y medir el rendimiento de LLMs.
Tipos de carga
| Tipo de carga | Descripción |
|---|---|
| 1k tokens de entrada | Aproximadamente 1,000 tokens de entrada, al menos 1,000 tokens de respuesta |
| 10k tokens de entrada | Aproximadamente 10,000 tokens de entrada, al menos 1,500 tokens de respuesta (benchmark por defecto en nuestro sitio) |
| 100k tokens de entrada | Aproximadamente 100,000 tokens de entrada, al menos 2,000 tokens de respuesta |
| Carga de visión | Una sola imagen de 1 megapíxel y aproximadamente 1,000 tokens de entrada, 1,000 tokens de salida |
Los prompts más largos pueden producir tanto un mayor tiempo hasta el primer token como tokens de salida por segundo más lentos en comparación con prompts más cortos.
Escenarios de carga
| Escenario de carga | Descripción |
|---|---|
| Prompt único | Se envía un prompt a la API del modelo cada vez |
| Prompts paralelos | Se envían 10 prompts a la API del modelo simultáneamente |
Frecuencia de prueba
- Nuestras cargas de 1k y 10k tokens de entrada y visión se prueban 8 veces al día, aproximadamente cada 3 horas
- Para nuestra prueba de carga múltiple o paralela, enviamos 10 solicitudes concurrentes de nuestra carga estándar de 1k tokens de entrada una vez al día en un momento aleatorio
- Nuestra carga de 100k tokens de entrada se prueba una vez por semana
Generación de prompts
Cada ejecución individual de prueba usa un prompt único que generamos en el momento de la prueba y ejecutamos en todos los endpoints que cubrimos. Los prompts combinan una variedad de contenido de entrada largo (por ejemplo, artículos) con varias tareas, incluyendo explicación/resumen, generación de preguntas y respuestas, análisis comparativo, traducción o generación de artefactos visuales.
Los parámetros del proceso de generación se configuran para llenar el presupuesto objetivo de tokens, produciendo salidas diversas que prueban una variedad de capacidades de razonamiento y generación.
La diversidad de prompts es importante para el benchmarking de rendimiento porque técnicas como speculative decoding hacen que veamos variación en las velocidades de salida según el tipo de salida.
Representación de las mediciones
Las mediciones de rendimiento se representan como la medición mediana (P50) durante las últimas 72 horas para reflejar cambios sostenidos de rendimiento que los usuarios pueden esperar experimentar al usar la API. Una excepción es la carga con longitud de prompt de 100k, que se prueba una vez por semana y se representa como la medición mediana (P50) durante los últimos 14 días.
Definiciones clave
- Tiempo hasta el primer token: El tiempo en segundos entre enviar una solicitud al servicio o sistema y recibir el primer token de la respuesta. Para modelos de razonamiento que devuelven tokens de razonamiento, este será el primer token de razonamiento.
- Tiempo hasta el primer token de respuesta: El tiempo en segundos entre enviar una solicitud al servicio o sistema y recibir el primer token de respuesta. Para modelos de razonamiento, se mide después de cualquier tiempo de 'pensamiento'.
- Velocidad de salida (tokens de salida por segundo): El número medio de tokens recibidos por segundo, después de recibir el primer token.
- Tiempo total de respuesta para 100 tokens de salida: El número de segundos necesarios para generar 100 tokens de salida, calculado sintéticamente a partir de TTFT y velocidad de salida para maximizar la utilidad comparativa.
- Tiempo de respuesta de extremo a extremo: El tiempo total para recibir una respuesta completa, incluyendo tiempo de procesamiento de entrada, tiempo de razonamiento del modelo y tiempo de generación de la respuesta.
- Tokens medios de razonamiento: Tiempo que los modelos de razonamiento pasan emitiendo tokens de 'razonamiento' antes de proporcionar una respuesta. Se calcula a partir del número medio de tokens de 'razonamiento' en un conjunto diverso de 60 prompts. Cuando el número medio de tokens de razonamiento no está disponible o aún no se ha calculado, asumimos 2k tokens de razonamiento. Estos prompts tienen longitudes variadas y cubren una gama de temas, incluyendo consultas personales, comerciales, programación, matemáticas, ciencia y otros. Los prompts combinan textos escritos por Artificial Analysis y otros obtenidos de las siguientes evaluaciones: MMLU Pro, AIME 2025 y LiveCodeBench. Se puede acceder a estos prompts aquí.
Detalles técnicos
Ubicación del servidor: Nuestro servidor principal de pruebas es una máquina virtual alojada en la zona us-central1-a de Google Cloud.
Cuentas de prueba: Realizamos pruebas usando una combinación de cuentas anónimas, cuentas con créditos y claves de API proporcionadas explícitamente para benchmarking. Cuando nuestro benchmarking principal no se realiza mediante una cuenta anónima, registramos una cuenta anónima separada y validamos que el rendimiento no esté siendo manipulado.
Librerías de API: Para todos los proveedores que afirman compatibilidad con la API de OpenAI, usamos la librería oficial de Python de OpenAI para garantizar consistencia entre pruebas. Para proveedores sin compatibilidad con OpenAI, usamos sus librerías cliente recomendadas.
Parámetros de API: Usamos los siguientes parámetros de API en todas las pruebas:
temperature: 0.6para modelos de razonamiento;temperature: 0para modelos sin razonamiento salvo que el creador del modelo especifique lo contrario.top_p: 1
Medición de tokens: Tenemos dos métodos para medir tokens:
- Para el benchmarking de rendimiento, medimos los tokens contados por la librería tiktoken de OpenAI (
o200k_base). Esto estandariza el número de tokens contado entre distintos modelos (con tokenizadores diferentes), de modo que el mismo texto se representa como el mismo número de tokens. - Para las evaluaciones del Artificial Analysis Intelligence Index, en cambio, usamos los recuentos de tokens reportados por la API de cada proveedor (incluidos los tokens de entrada en caché, de razonamiento y de salida), que nos permiten informar con mayor precisión el coste de ejecutar el Artificial Analysis Intelligence Index. Al informar las tasas de aciertos de caché y el coste, combinamos estos recuentos con mediciones en vivo de la tasa de aciertos de caché típica de cada modelo, en lugar de basarnos en la medición puntual del momento en que se ejecutó la evaluación.
Cálculo de velocidad de salida: Para modelos de razonamiento que no exponen todos los tokens de razonamiento en la respuesta, calculamos la velocidad de salida usando el último 80% de los chunks de respuesta. Esto garantiza que las velocidades de salida medidas sean consistentes y reflejen más de cerca la experiencia del usuario.
Limitaciones conocidas
Eficiencia del tokenizador y precios: Distintos modelos usan distintos tokenizadores, lo que puede generar diferencias en el número de tokens necesarios para representar el mismo texto. Esto significa que los precios no siempre son directamente comparables entre modelos. Estamos trabajando en publicar más detalles sobre eficiencia de tokenizadores y su impacto en los precios. Mientras tanto, hemos compartido en Twitter algunos análisis preliminares de precios ajustados por eficiencia de tokenizadores.
Cuantización: Algunos modelos usan técnicas de cuantización para reducir requisitos computacionales y aumentar la velocidad. Sin embargo, la cuantización también puede afectar la calidad del modelo. Estamos avanzando hacia la divulgación completa de los métodos de cuantización usados por los modelos que evaluamos.
Ubicación del servidor y TTFT: Time-to-first-token (TTFT) es sensible a la ubicación del servidor porque incluye latencia de red. Nuestro servidor principal de pruebas está ubicado en la zona us-central1-a de Google Cloud, lo que puede favorecer o perjudicar a determinados proveedores según la ubicación de sus servidores. Estamos considerando añadir ubicaciones de prueba adicionales para mitigar este efecto.
Historial de versiones
Versión 2.2.0
2 de marzo de 2026
- Prompts actualizados: hemos introducido un conjunto mejorado de prompts con contenido más amplio y variado, que incluye una mayor variedad de tipos de tarea. Esto es importante porque técnicas como speculative decoding hacen que veamos variación en las velocidades de salida según el tipo de salida.
- Cambio de carga por defecto: la velocidad por defecto en nuestro sitio ahora refleja resultados de prompts con 10k tokens de entrada (antes 1k) y hemos dejado obsoletas las mediciones de rendimiento para cargas de 100 tokens de entrada. Todas las cargas de 1k, 10k y 100k tokens de entrada siguen visibles en todas las páginas seleccionando el desplegable Opciones de prompt. La forma más sencilla de comparar velocidades de salida para diferentes formas de carga es usar el gráfico Velocidad de salida por cantidad de tokens de entrada.
Integrity Terms
Background
Artificial Analysis is an independent AI benchmarking and insights provider. Our benchmarks are widely referenced and consulted by millions of users and organizations.
We strive to ensure that all data published on Artificial Analysis is fair, transparent, and representative of the typical experience of developers and organizations using the models and endpoints we cover. Our inference benchmarking data is widely used as a reference standard for comparing inference providers across dimensions such as speed, latency, and quality. The value of these measurements depends on them reflecting the experience of an ordinary developer using a provider's standard, publicly available endpoint.
These terms formalize the approach Artificial Analysis has taken since we began benchmarking inference performance. They apply equally to all inference providers and platforms (together, "providers") that publish serverless endpoint data on Artificial Analysis, and they ensure every provider is measured on the same fair basis.
Provider Requirements
Traffic from Artificial Analysis must be served on the same publicly available configuration that any ordinary developer would receive when using the endpoint. In particular, providers must not:
- Detect, fingerprint, or otherwise identify Artificial Analysis traffic (whether by account, API key, IP address, request headers, payloads, or traffic patterns) and serve it differently from ordinary traffic.
- Route Artificial Analysis traffic to dedicated, reserved, or non-public resources, including separate hardware, capacity pools, priority queues, or geographic regions that are not generally available.
- Serve Artificial Analysis a model, quantization, context length, or endpoint configuration that differs from what is publicly advertised and generally available under the same name.
- Serve Artificial Analysis traffic at a batch size, concurrency, or load configuration that is not representative of what ordinary traffic on the same endpoint receives (for example, running benchmark requests at reduced batch sizes to increase per-request speed).
On request, providers must confirm the model version, precision or quantization, and context length serving Artificial Analysis traffic, and confirm that this matches the standard public offering. Providers must ensure that every employee, contractor, advisor, or affiliate who is aware that an endpoint is being measured by Artificial Analysis complies with this policy.
Performance features that are part of the standard public offering and available to all developers on equivalent terms (for example, autoscaling, generally available caching, or published tiering that any customer can access) are not a violation, provided they are not applied selectively to Artificial Analysis traffic.
Compliance Process
Artificial Analysis lists endpoints and providers at its sole discretion. We reserve the right to delist any endpoint or provider that does not comply with these terms, and to decline, withhold, or remove any listing for any reason.
We conduct frequent consistency checks on every endpoint we measure. As standard practice, we measure from our primary Artificial Analysis account alongside independent test accounts, each created and used in the same way an ordinary developer would. Where these return materially different results on identical payloads and the same endpoint, we investigate before drawing conclusions.
If we detect or reasonably suspect that Artificial Analysis traffic is being served differently from the standard public offering, we may:
- Withhold, remove, or delay publication of affected measurements.
- Re-measure on a standard, publicly created account and publish those results.
- Remove the endpoint or provider from performance leaderboards and listings.
- Suspend the provider across all leaderboards.
- Publicly disclose that a provider has served non-representative performance to Artificial Analysis.
By submitting endpoints to Artificial Analysis, providers acknowledge these terms and our shared commitment to maintaining benchmark integrity. Artificial Analysis may update this policy at any time.
We appreciate your cooperation in maintaining the integrity of our benchmarks. If you have questions or concerns, please reach out to our team.