Metodologia do teste de carga de sistema (AA-SLT)
Visão geral
O benchmark mede o desempenho do sistema mantendo um número fixo de consultas paralelas enviadas ao sistema durante a fase de teste. Assim que uma consulta é concluída, outra é enviada imediatamente à máquina. Isso garante que o sistema seja avaliado com uma carga estável e também reduz a variação do teste.
Medimos a quantidade total de tokens recebidos do sistema durante cada fase, que contribui para nossa métrica de vazão de saída do sistema. Também medimos o desempenho de cada consulta, que contribui para nossas métricas por consulta (geralmente apresentadas como mediana ou média).
O benchmark é realizado em fases. Cada fase de benchmarking dura 3 minutos, e o número de consultas simultâneas aumenta a cada fase subsequente. O benchmarking continua até que a vazão de saída do sistema atinja seu limite, ou seja, até que o aumento da simultaneidade deixe de produzir tokens adicionais em comparação com os períodos anteriores.
Principais especificações técnicas
- Duração da fase: Cada fase dura 3 minutos (excluindo os períodos de aumento e redução de carga).
- Níveis de simultaneidade: 1, 2, 4, 8, 16, 32, 64 e, depois, incrementos de 64 até que o limite da vazão de saída do sistema se estabilize.
- Formato da carga de trabalho: 1.000 tokens de entrada e 1.000 tokens de saída por consulta.
- Streaming: O benchmarking é realizado com o streaming ativado.

Teste de carga de sistema da Artificial Analysis (exemplo com 4 solicitações simultâneas)
Principais métricas medidas
- Vazão de saída do sistema: Média do total de tokens de saída por segundo em todas as solicitações simultâneas durante a fase de benchmarking.
- Taxa de resposta: Proporção de consultas enviadas durante a fase de benchmarking que receberam resposta (pelo menos 1 token de saída).
- Latência de ponta a ponta por consulta: Tempo de resposta de ponta a ponta de cada consulta, contado a partir do envio. Os números apresentados correspondem à mediana de cada fase de simultaneidade.
- Velocidade de saída por consulta: Número de tokens de saída por segundo após o recebimento do primeiro token de cada consulta. Os números apresentados correspondem à mediana de cada fase de simultaneidade.