Metodologia do teste de carga de sistema (AA-SLT)

Visão geral

O benchmark mede o desempenho do sistema mantendo um número fixo de consultas paralelas enviadas ao sistema durante a fase de teste. Assim que uma consulta é concluída, outra é enviada imediatamente à máquina. Isso garante que o sistema seja avaliado com uma carga estável e também reduz a variação do teste.

Medimos a quantidade total de tokens recebidos do sistema durante cada fase, que contribui para nossa métrica de vazão de saída do sistema. Também medimos o desempenho de cada consulta, que contribui para nossas métricas por consulta (geralmente apresentadas como mediana ou média).

O benchmark é realizado em fases. Cada fase de benchmarking dura 3 minutos, e o número de consultas simultâneas aumenta a cada fase subsequente. O benchmarking continua até que a vazão de saída do sistema atinja seu limite, ou seja, até que o aumento da simultaneidade deixe de produzir tokens adicionais em comparação com os períodos anteriores.

Principais especificações técnicas

  • Duração da fase: Cada fase dura 3 minutos (excluindo os períodos de aumento e redução de carga).
  • Níveis de simultaneidade: 1, 2, 4, 8, 16, 32, 64 e, depois, incrementos de 64 até que o limite da vazão de saída do sistema se estabilize.
  • Formato da carga de trabalho: 1.000 tokens de entrada e 1.000 tokens de saída por consulta.
  • Streaming: O benchmarking é realizado com o streaming ativado.
Ilustração do teste de carga de sistema

Teste de carga de sistema da Artificial Analysis (exemplo com 4 solicitações simultâneas)

Principais métricas medidas

  • Vazão de saída do sistema: Média do total de tokens de saída por segundo em todas as solicitações simultâneas durante a fase de benchmarking.
  • Taxa de resposta: Proporção de consultas enviadas durante a fase de benchmarking que receberam resposta (pelo menos 1 token de saída).
  • Latência de ponta a ponta por consulta: Tempo de resposta de ponta a ponta de cada consulta, contado a partir do envio. Os números apresentados correspondem à mediana de cada fase de simultaneidade.
  • Velocidade de saída por consulta: Número de tokens de saída por segundo após o recebimento do primeiro token de cada consulta. Os números apresentados correspondem à mediana de cada fase de simultaneidade.