System Load Test (AA-SLT) 방법론

개요

이 벤치마크는 테스트 단계에서 고정된 수의 병렬 쿼리를 시스템에 계속 보내 시스템 성능을 측정합니다. 각 쿼리가 완료되는 즉시 머신에 다음 쿼리를 보냅니다. 이를 통해 안정적인 부하에서 시스템을 벤치마킹하는 동시에 테스트 편차를 최소화합니다.

각 단계에서 시스템으로부터 받은 토큰의 총량을 측정하여 시스템 출력 처리량 지표에 반영합니다. 쿼리별 성능도 측정하여 쿼리별 지표에 반영하며, 일반적으로 중앙값이나 평균으로 나타냅니다.

벤치마크는 단계별 방식으로 수행합니다. 각 벤치마킹 단계는 3분 동안 진행하며, 다음 단계로 넘어갈 때마다 동시 쿼리 수를 늘립니다. 시스템의 출력 처리량이 상한에 도달할 때까지 벤치마킹을 계속합니다. 상한에 도달하면 동시성을 높여도 이전 기간보다 더 많은 토큰을 받지 못합니다.

주요 기술 사양

  • 단계 진행 시간: 각 단계는 3분 동안 진행합니다(램프업 및 쿨다운 기간 제외).
  • 동시성 수준: 1, 2, 4, 8, 16, 32, 64로 늘린 뒤, 시스템 출력 처리량 상한이 평탄해질 때까지 64씩 증가시킵니다.
  • 워크로드 구성: 쿼리당 입력 토큰 1,000개와 출력 토큰 1,000개를 사용합니다.
  • 스트리밍: 스트리밍을 활성화한 상태에서 벤치마킹합니다.
System Load Test 그림

Artificial Analysis System Load Test(동시 요청 4개 예시)

측정하는 주요 지표

  • 시스템 출력 처리량: 벤치마킹 단계 동안 모든 동시 요청에서 발생한 초당 출력 토큰 수를 합산한 평균입니다.
  • 응답률: 벤치마킹 단계에서 전송한 쿼리 중 응답(출력 토큰 1개 이상)을 받은 쿼리의 비율입니다.
  • 쿼리당 종단 간 지연 시간: 쿼리를 전송한 시점부터 측정한 각 쿼리의 종단 간 응답 시간입니다. 수치는 각 동시성 단계의 중앙값으로 표시합니다.
  • 쿼리당 출력 속도: 각 쿼리에서 첫 토큰을 받은 후의 초당 출력 토큰 수입니다. 수치는 각 동시성 단계의 중앙값으로 표시합니다.