AA-AgentPerf 방법론

개요

AA-AgentPerf는 현실적인 에이전트 워크로드에서 에이전트별 속도 목표를 충족하며 추론 배포 환경이 지원할 수 있는 활성 에이전트 수를 측정하는 하드웨어 벤치마크입니다.

  • 실제 에이전트 실행 궤적 — 추론, 도구 호출, 가변적인 컨텍스트 길이가 섞인 여러 턴의 코딩 세션입니다. 일률적으로 만든 합성 프롬프트가 아닙니다.
  • 지속적인 동시 부하 — 시뮬레이션 에이전트가 처리 중인 요청을 지속적으로 유지해 KV 캐시 재사용, 추측 디코딩, 스케줄러 동작에 부하를 줍니다.
  • 시장 데이터 기반 SLO 등급 — Artificial Analysis의 서버리스 API 벤치마킹 데이터를 기반으로 한 성능 임계값으로, 여러 제공업체에서 관측되는 서비스 품질 수준을 반영합니다.
  • 지속적인 업데이트 — 새 하드웨어, 소프트웨어 스택, 모델 버전이 제공됨에 따라 결과를 계속 업데이트합니다.
  • 프로덕션 준비 완료 — 현실적인 최적화를 활성화하고 프로덕션 규모의 배포 토폴로지에서 모델을 테스트합니다.
concurrent agents0/ 9INFERENCESYSTEMAGENT 1AGENT 2AGENT 3AGENT 4AGENT 5AGENT 6AGENT 7AGENT 8AGENT 9system throughputoutput speed per agent

각 시뮬레이션 에이전트는 에이전트 코딩 궤적을 따라 추론하고, 도구를 호출하고, 코드를 편집하는 작업을 순차적으로 수행하며, 시스템은 동시 실행 수가 늘어나는 상황을 지원하도록 확장됩니다.

데이터 세트

AA-AgentPerf 데이터 세트에는 여러 사용 사례, 프로그래밍 언어, 모델을 아우르는 실제 에이전트 실행 궤적이 담겨 있습니다. 추론을 활성화한 세 가지 최상위 오픈 소스 모델인 DeepSeek V3.2, GLM 4.7, Kimi K2.5에 실제 공개 코드 저장소의 이슈를 해결하도록 지시하고 OpenCode 에이전트 하니스에서 궤적을 생성했습니다. 모든 궤적에는 추론과 도구 호출이 교차해 포함됩니다.

  • 입력 시퀀스 길이(Input Sequence Length, ISL): 약 5K~131K 토큰이며 평균은 약 27K 토큰입니다. 테스트 대상 모델의 최대 권장 컨텍스트 길이에 맞도록 궤적을 잘라냅니다.
  • 출력 시퀀스 길이(Output Sequence Length, OSL): 출력 길이는 턴마다 크게 다릅니다. 단순한 도구 호출처럼 짧은 출력을 생성하는 턴도 있고, 모델이 응답하거나 행동하기 전에 긴 추론을 수행하는 턴도 있습니다.
  • 언어: 소스 저장소의 주 언어를 기준으로 12개 이상의 프로그래밍 언어가 포함됩니다. Python 저장소가 가장 많고 TypeScript와 Go가 뒤를 잇습니다.
  • 도구 호출 지연: 도구 호출 후에는 호출한 도구별 실제 도구 호출 시간 분포에서 추출한 고정 메시지당 지연으로 처리 시간을 시뮬레이션합니다. 지연은 0.1초 미만부터 5초까지이며 중앙값은 약 1초입니다.

구성 검증과 성능 튜닝을 위해 고유한 궤적 500개와 프롬프트 18,997개로 이루어진 대표 튜닝 하위 집합을 테스트 참가자에게 제공합니다. 벤치마크만을 겨냥한 최적화를 막기 위해 전체 테스트 데이터 세트는 비공개로 유지합니다.

서비스 수준 목표

성능 SLO는 Artificial Analysis의 서버리스 API 벤치마킹 데이터를 바탕으로 정합니다. 테스트하는 각 모델에 대해 현재 시장에서 제공되는 서비스 등급을 파악했습니다. 공급업체는 각 등급을 개별 목표로 삼아 해당 서비스 수준에서 지원할 수 있는 동시 에이전트 수를 최대화합니다.

속도와 지연 시간은 모두 요청별로 계산합니다. 에이전트 워크로드에는 OSL이 짧은 요청이 많으므로 P25 출력 속도를 사용하며, 백분위수는 한 단계 동안 전송한 모든 요청을 대상으로 계산합니다.

각 모델은 개발사가 권장하는 샘플링 매개변수와 사용 가능한 최대 사고 노력으로 테스트합니다. DeepSeek V4 Pro와 Kimi K3에는 max reasoning effort, gpt-oss-120b에는 high reasoning effort를 적용하고, 그 밖의 모든 매개변수는 기본값으로 설정합니다.

현재 별도의 출력 속도 및 TTFT 지표에서 두 값을 결합한 E2E 속도 지표로 전환하고 있습니다. 전환 기간에는 일부 통계를 속도/TTFT로, 일부는 E2E 속도로 표시합니다.

모델SLO 등급P25 출력 속도(토큰/초)P95 TTFT(초)
DeepSeek V4 Pro (max)SLO #12010
SLO #2605
SLO #31803
gpt-oss-120b (high)SLO #11005
SLO #22503
SLO #35002
SLO #42,0001
Kimi K3 (max)Kimi K3를 대상으로 파레토 프런티어 전체에 초점을 맞춘 새로운 비SLO 구성을 시험하고 있습니다.

성능 SLO

테스트 실행

각 SLO에서 지원되는 에이전트 수는 초기에 지수적으로 부하를 높인 다음 이진 탐색으로 결정합니다. 정상 상태의 토큰 타이밍 정보를 사용해 지표를 계산합니다. 한 단계가 끝나 지표 계산이 완료되면 시스템에서 SLO 위반 여부를 판단한 뒤 다음 목표 동시 실행 수준으로 진행합니다. 각 단계는 궤적이 30개 이상 완료되고, 모든 시뮬레이션 에이전트가 궤적을 3개 이상 완료했으며, 정상 상태 측정 시간이 10분 이상 경과할 때까지 실행합니다. 에이전트에 할당되는 궤적은 단계가 바뀌어도 결정론적으로 유지되며, 단계 간 접두사 캐싱을 방지하기 위해 각 단계에서 모든 궤적의 시작 부분에 동적으로 생성된 접두사를 추가합니다. max_tokens 값을 16K로 설정해 모델이 반복 루프에 빠진 개별 요청이 결과를 왜곡하지 않도록 합니다.

RAMPdoubling the load until a target breaks
0100200300400048121620concurrent agentsp25 output speed (t/s)SLO threshold (100 t/s)max = 11
PhaseAgentsp25 SpeedResult
max agents = 11

동시 에이전트 수가 늘어나면 요청별 출력 속도가 떨어집니다. 각 SLO 등급에서 허용되는 최소 속도를 정하며, 이에 따라 해당 등급에서 지원할 수 있는 최대 에이전트 수가 결정됩니다.

지표 및 결과

각 테스트 단계에서 다음 타이밍 지표를 계산합니다.

  • 첫 토큰까지 걸린 시간(Time to First Token, TTFT): 요청을 보낸 시점부터 첫 출력 토큰을 받을 때까지의 요청별 지연 시간입니다.
  • 출력 속도: 첫 토큰을 받은 뒤 측정한 요청별 초당 출력 토큰 수입니다.
  • E2E 속도: 첫 토큰을 기다린 시간까지 포함해 전체 요청에서 측정한 요청별 초당 출력 토큰 수입니다. 이 단일 지표가 위의 두 지표를 대체하고 있습니다.
  • 시스템 출력 처리량: 모든 동시 에이전트가 생성한 초당 출력 토큰 수의 합계입니다.

모든 지표는 목표 동시 실행 수준에서 모든 에이전트가 30초 이상 활성 상태를 유지한 정상 상태 구간만 포함하도록 필터링합니다. 속도 지표에는 추론 프레임워크가 반환한 사용량 메타데이터의 서버 측 토큰 수를 사용하고, 후보 모델의 네이티브 토크나이저로 로컬에서 토큰화한 결과와 대조해 검증합니다. 실제 테스트 중 각 가속기의 전력 소비량을 측정합니다. 하드웨어 구성 간 공정한 비교가 가능하도록 주요 결과인 SLO 등급별 최대 동시 에이전트 수와 출력 처리량을 가속기당 및 MW당 수치로 정규화합니다. MW당 수치는 정격 TDP가 아니라 부하 상태에서 측정한 가속기 전력(GPU 다이 + HBM)을 기준으로 합니다.

결과는 제공업체가 공개한 전체 시스템 구성과 함께 Artificial Analysis 리더보드에 게시됩니다. 제공업체는 게시 전에 사실관계가 정확한지 결과를 검토할 수 있습니다.

제출

AA-AgentPerf 평가를 위해 시스템을 제출하고자 하는 하드웨어 공급업체이며 아직 담당자와 연락하고 있지 않다면 agentperf@artificialanalysis.ai로 문의해 주세요.