Metodología de prueba de carga de sistemas (AA-SLT)
Resumen
El benchmark mide el rendimiento del sistema manteniendo números fijos de consultas paralelas enviadas al sistema durante la fase de prueba. Cuando cada consulta individual termina, se envía inmediatamente otra consulta a la máquina. Esto garantiza que el sistema se evalúe con una carga estable y minimiza la varianza de la prueba.
Se mide la cantidad agregada de tokens recibidos del sistema durante cada fase, y esta contribuye a nuestra métrica de capacidad de salida del sistema. También se mide el rendimiento por consulta, que contribuye a nuestras métricas por consulta (normalmente representadas como mediana o media).
El benchmark se realiza con un enfoque por fases. Cada fase de benchmarking dura 3 minutos, y el número de consultas concurrentes escala en cada fase posterior. El benchmarking continúa hasta alcanzar el techo de capacidad de salida del sistema, lo que significa que con mayor concurrencia no se reciben tokens adicionales respecto a los períodos anteriores.
Especificaciones técnicas clave
- Duración de la fase: Cada fase dura 3 minutos (excluyendo períodos de calentamiento y enfriamiento).
- Niveles de concurrencia: 1, 2, 4, 8, 16, 32, 64, y luego incrementos de 64 hasta que el techo de capacidad de salida del sistema se estabiliza.
- Forma de la carga de trabajo: 1,000 tokens de entrada y 1,000 tokens de salida por consulta.
- Streaming: El benchmarking se realiza con streaming activado.

Prueba de carga de sistemas de Artificial Analysis (ejemplo con 4 solicitudes concurrentes)
Métricas clave medidas
- Capacidad de salida del sistema: El promedio agregado de tokens de salida por segundo en todas las solicitudes concurrentes durante la fase de benchmarking.
- Tasa de respuesta: La proporción de consultas enviadas durante la fase de benchmarking que recibieron respuestas (al menos 1 token de salida).
- Latencia de extremo a extremo por consulta: El tiempo de respuesta de extremo a extremo de cada consulta desde el momento en que se envía. Las cifras se reportan como la mediana de cada fase de concurrencia.
- Velocidad de salida por consulta: Tokens de salida por segundo después de recibir el primer token para cada consulta. Las cifras se reportan como la mediana de cada fase de concurrencia.