Metodología de benchmarking de Artificial Analysis
Alcance
Artificial Analysis realiza benchmarks de inteligencia, calidad, rendimiento y precio de modelos de IA, endpoints de APIs de inferencia y sistemas. Esta sección de nuestro sitio web describe nuestra metodología de benchmarking, incluyendo nuestros benchmarks de calidad y de rendimiento.
Para nuestros benchmarks de modelos de lenguaje, consideramos que los endpoints son serverless cuando los clientes solo pagan por su uso, no una tarifa fija por acceder a un sistema. Normalmente esto significa que los endpoints tienen precios por token, a menudo con precios distintos para tokens de entrada y de salida.
En todas las modalidades, nuestros benchmarks de rendimiento miden el rendimiento de extremo a extremo que experimentan los clientes de servicios y sistemas de inferencia de IA. Esto significa que los resultados no buscan representar el rendimiento máximo posible en una plataforma de hardware concreta, sino el rendimiento real que los clientes experimentan entre proveedores.
Evaluamos tanto modelos propietarios como modelos de pesos abiertos.
Detalles de metodología
Definiciones
En esta página, y en todo el sitio web de Artificial Analysis, usamos los siguientes términos:
- Modelo: Un modelo de lenguaje grande (LLM), incluyendo modelos propietarios, de código abierto y de pesos abiertos.
- Creador del modelo: La organización que desarrolló y entrenó el modelo. Por ejemplo, OpenAI es el creador de GPT-4 y Meta es el creador de Llama 3.
- Endpoint: Una instancia alojada de un modelo a la que se puede acceder mediante una API. Un mismo modelo puede tener varios endpoints en distintos proveedores.
- Sistema: Un entorno de cómputo dedicado para ejecutar modelos de IA, normalmente infraestructura provisionada como una VM, que puede evaluarse en rendimiento bajo carga.
- Proveedor: Una empresa que aloja y proporciona acceso a uno o más endpoints o sistemas de modelos. Algunos ejemplos son OpenAI, AWS Bedrock, Together.ai y otros. Las empresas suelen ser tanto creadoras de modelos como proveedoras.
- Serverless: Servicio en la nube proporcionado según uso. En APIs de inferencia de LLMs generalmente significa precio por token de entrada y salida. Los productos serverless en la nube igualmente se ejecutan en servidores.
- Pesos abiertos: Un modelo cuyos pesos han sido publicados por su creador. Usamos 'pesos abiertos' o simplemente modelos 'abiertos' en lugar de 'open-source', porque muchos LLMs abiertos se publican con licencias que no cumplen la definición completa de software de código abierto.
- Token: Los LLMs modernos se construyen alrededor de tokens: representaciones numéricas de palabras y caracteres. Los LLMs reciben tokens como entrada y generan tokens como salida. El texto de entrada se traduce en tokens mediante un tokenizador. Distintos LLMs usan distintos tokenizadores.
- Tokens de OpenAI: Tokens generados por el tokenizador de GPT-3.5 y GPT-4 de OpenAI, medidos normalmente para los benchmarks de Artificial Analysis con el paquete tiktoken de OpenAI para Python (tokenizador o200k_base). Usamos tokens de OpenAI como unidad estándar de medición en Artificial Analysis para permitir comparaciones justas entre modelos. Todas las métricas de 'tokens por segundo' se refieren a tokens de OpenAI.
- Tokens nativos: Tokens generados por el tokenizador propio de un LLM. Usamos 'tokens nativos' para distinguirlos de los 'tokens de OpenAI'. Los precios generalmente se refieren a tokens nativos.
- Precio (entrada/salida): El precio que cobra un proveedor por token de entrada enviado al modelo y por token de salida recibido del modelo. Los precios mostrados son los precios actuales publicados por los proveedores.
- Precio combinado: Para facilitar la comparación, calculamos un precio combinado asumiendo una proporción 7:2:1 de tokens con acierto de caché, entrada y salida.
- Coste por tarea: El coste medio ponderado (USD) para completar una tarea del Artificial Analysis Intelligence Index. Para cada benchmark calculamos el precio de los tokens de entrada, de caché y de salida que el modelo realmente utiliza, dividimos entre su número de tareas y ponderamos por el peso del benchmark en el Intelligence Index. El precio es la tarifa de la API de primera parte del proveedor, o la mediana entre proveedores cuando esta no está disponible. Como el coste refleja el uso real de tokens, los modelos que razonan más o que producen respuestas más largas tienen un coste por tarea mayor, incluso con los mismos precios por token.
donde i = cada benchmark del Artificial Analysis Intelligence Index, y los tokens de caché incluyen tanto lecturas como escrituras de caché, cada una con su respectiva tarifa de caché
- Tiempo hasta el primer token: El tiempo en segundos entre enviar una solicitud al servicio o sistema y recibir el primer token de la respuesta. Para modelos de razonamiento que devuelven tokens de razonamiento, este será el primer token de razonamiento.
- Tiempo hasta el primer token de respuesta: El tiempo en segundos entre enviar una solicitud al servicio o sistema y recibir el primer token de respuesta. Para modelos de razonamiento, se mide después de cualquier tiempo de 'pensamiento'.
- Velocidad de salida (tokens de salida por segundo): El número medio de tokens recibidos por segundo, después de recibir el primer token.
- Tiempo total de respuesta para 100 tokens de salida: El número de segundos necesarios para generar 100 tokens de salida, calculado sintéticamente a partir de TTFT y velocidad de salida para maximizar la utilidad comparativa.
- Tiempo de respuesta de extremo a extremo: El tiempo total para recibir una respuesta completa, incluyendo tiempo de procesamiento de entrada, tiempo de razonamiento del modelo y tiempo de generación de la respuesta.
- Tokens medios de razonamiento: Tiempo que los modelos de razonamiento pasan emitiendo tokens de 'razonamiento' antes de proporcionar una respuesta. Se calcula a partir del número medio de tokens de 'razonamiento' en un conjunto diverso de 60 prompts. Cuando el número medio de tokens de razonamiento no está disponible o aún no se ha calculado, asumimos 2k tokens de razonamiento. Estos prompts tienen longitudes variadas y cubren una gama de temas, incluyendo consultas personales, comerciales, programación, matemáticas, ciencia y otros. Los prompts combinan textos escritos por Artificial Analysis y otros obtenidos de las siguientes evaluaciones: MMLU Pro, AIME 2025 y LiveCodeBench. Se puede acceder a estos prompts aquí.