Artificial Analysis 언어 모델 API 성능 벤치마킹 방법론
개요
LLM 성능을 측정하려면 LLM에 프롬프트를 보내고 출력의 특성을 측정해야 합니다. 다양한 테스트 워크로드를 사용해 LLM 성능을 테스트하고 측정합니다.
워크로드 유형
| 워크로드 유형 | 설명 |
|---|---|
| 입력 토큰 1k개 | 입력 토큰 약 1,000개, 답변 토큰 최소 1,000개 |
| 입력 토큰 10k개 | 입력 토큰 약 10,000개, 답변 토큰 최소 1,500개(웹사이트의 기본 벤치마크) |
| 입력 토큰 100k개 | 입력 토큰 약 100,000개, 답변 토큰 최소 2,000개 |
| 비전 워크로드 | 1메가픽셀 이미지 1개와 입력 토큰 약 1,000개, 출력 토큰 1,000개 |
프롬프트가 길수록 짧은 프롬프트에 비해 첫 토큰 도달 시간이 길어지고 초당 출력 토큰 수도 줄어들 수 있습니다.
부하 시나리오
| 부하 시나리오 | 설명 |
|---|---|
| 단일 프롬프트 | 한 번에 하나의 프롬프트를 모델 API로 전송합니다. |
| 병렬 프롬프트 | 프롬프트 10개를 모델 API로 동시에 전송합니다. |
테스트 빈도
- 입력 토큰 1k개 및 10k개 워크로드와 비전 워크로드는 약 3시간마다 하루 8회 테스트합니다.
- 다중 또는 병렬 워크로드 테스트에서는 표준 입력 토큰 1k개 워크로드의 동시 요청 10개를 하루 한 번 무작위 시점에 전송합니다.
- 입력 토큰 100k개 워크로드는 일주일에 한 번 테스트합니다.
프롬프트 생성
각 테스트 실행에는 테스트 시점에 생성한 고유 프롬프트를 사용하며, 벤치마킹 대상인 모든 엔드포인트에서 이를 실행합니다. 프롬프트는 기사 같은 다양한 장문 입력 콘텐츠와 설명/요약, 질문 및 답변 생성, 비교 분석, 번역, 시각적 결과물 생성 등의 다양한 작업을 결합합니다.
생성 과정의 매개변수는 목표 토큰 예산을 채우도록 설정해 다양한 추론 및 생성 능력을 테스트하는 여러 형태의 출력을 생성합니다.
추측 디코딩 같은 기법으로 인해 출력 유형에 따라 출력 속도가 달라지므로, 성능 벤치마킹에서 프롬프트의 다양성은 중요합니다.
측정값 표시 방식
성능 측정값은 사용자가 API를 이용할 때 체감할 수 있는 지속적인 성능 변화를 반영하도록 최근 72시간 측정값의 중앙값(P50)으로 표시합니다. 단, 프롬프트 길이 100k 워크로드는 일주일에 한 번 테스트하며 최근 14일 측정값의 중앙값(P50)으로 표시합니다.
주요 정의
- 첫 토큰까지 걸린 시간: 서비스 또는 시스템에 요청을 보낸 시점부터 응답의 첫 토큰을 받은 시점까지의 시간(초)입니다. 추론 토큰을 반환하는 추론 모델에서는 첫 추론 토큰이 이에 해당합니다.
- 첫 답변 토큰까지 걸린 시간: 서비스 또는 시스템에 요청을 보낸 시점부터 응답의 첫 답변 토큰을 받은 시점까지의 시간(초)입니다. 추론 모델에서는 '사고' 시간이 모두 끝난 뒤부터 측정합니다.
- 출력 속도(초당 출력 토큰 수): 첫 토큰을 받은 후 초당 수신한 평균 토큰 수입니다.
- 출력 토큰 100개의 총 응답 시간: 출력 토큰 100개를 생성하는 데 걸리는 시간(초)으로, 비교 효용을 극대화하기 위해 TTFT와 출력 속도를 바탕으로 종합적으로 계산합니다.
- 종단 간 응답 시간: 입력 처리 시간, 모델 추론 시간, 답변 생성 시간을 포함하여 완전한 응답을 받기까지 걸리는 총시간입니다.
- 평균 추론 토큰 수: 추론 모델이 답변을 제공하기 전에 '추론' 토큰을 출력하는 데 사용하는 시간입니다. 다양한 프롬프트 60개에서 생성된 평균 '추론' 토큰 수를 바탕으로 계산합니다. 평균 추론 토큰 수를 확인할 수 없거나 아직 계산하지 않은 경우 추론 토큰 2k개로 가정합니다. 프롬프트 길이는 다양하며 개인 관련 질의, 상업 관련 질의, 코딩, 수학, 과학 등 여러 주제를 다룹니다. Artificial Analysis가 작성한 프롬프트와 MMLU Pro, AIME 2025, LiveCodeBench 평가에서 가져온 프롬프트를 함께 사용합니다. 이 프롬프트는 여기에서 확인할 수 있습니다.
기술 세부 정보
서버 위치: 주 테스트 서버는 Google Cloud의 us-central1-a 영역에서 호스팅되는 가상 머신입니다.
테스트 계정: 익명 계정, 크레딧이 있는 계정, 벤치마킹 목적으로 명시적으로 제공된 API 키를 조합해 테스트합니다. 주 벤치마킹에 익명 계정을 사용하지 않는 경우에는 별도의 익명 계정을 등록하고 성능이 조작되지 않았는지 검증합니다.
API 라이브러리: OpenAI API와의 호환성을 표방하는 모든 제공업체에는 테스트 간 일관성을 보장하기 위해 공식 OpenAI Python 라이브러리를 사용합니다. OpenAI와 호환되지 않는 제공업체에는 해당 업체가 권장하는 클라이언트 라이브러리를 사용합니다.
API 매개변수: 모든 테스트에 다음 API 매개변수를 사용합니다:
- 추론 모델에는
temperature: 0.6을 사용하고, 비추론 모델에는 모델 개발사가 달리 지정하지 않는 한temperature: 0을 사용합니다. top_p: 1
토큰 측정: 토큰 측정에는 두 가지 방법을 사용합니다:
- 성능 벤치마킹에서는 OpenAI의 tiktoken 라이브러리(
o200k_base)로 계산한 토큰 수를 측정합니다. 이렇게 하면 서로 다른 토크나이저를 사용하는 모델 간에도 토큰 수 계산을 표준화하여 같은 텍스트가 같은 수의 토큰으로 표현됩니다. - 반면 Artificial Analysis Intelligence Index 평가에서는 각 모델의 API 제공업체가 보고하는 토큰 수(캐시된 입력 토큰, 추론 토큰, 출력 토큰 포함)를 사용합니다. 이를 통해 Intelligence Index 실행 비용을 더 정확히 보고할 수 있습니다. 캐시 적중률과 비용을 보고할 때는 평가 실행 시점의 일회성 측정값에 의존하지 않고, 이 수치와 각 모델의 일반적인 캐시 적중률을 실시간으로 측정한 값을 결합합니다.
출력 속도 계산: 응답에서 모든 추론 토큰을 공개하지 않는 추론 모델은 답변 청크의 마지막 80%를 사용해 출력 속도를 계산합니다. 이를 통해 측정된 출력 속도의 일관성을 확보하고 사용자 경험을 더 가깝게 반영합니다.
알려진 한계
토크나이저 효율성과 가격: 모델마다 서로 다른 토크나이저를 사용하므로 같은 텍스트를 표현하는 데 필요한 토큰 수가 달라질 수 있습니다. 따라서 모델 간 가격을 항상 직접 비교할 수 있는 것은 아닙니다. 토크나이저 효율성과 가격에 미치는 영향에 관한 자세한 내용을 공개하기 위해 노력하고 있습니다. 그동안 토크나이저 효율성을 반영해 조정한 예비 가격 분석을 Twitter에서 공유했습니다.
양자화: 일부 모델은 컴퓨팅 요구 사항을 줄이고 속도를 높이기 위해 양자화 기법을 사용합니다. 하지만 양자화는 모델 품질에도 영향을 줄 수 있습니다. 벤치마킹하는 모델에 사용된 양자화 방식을 모두 공개하는 방향으로 나아가고 있습니다.
서버 위치 및 TTFT: 첫 토큰 도달 시간(TTFT)에는 네트워크 지연이 포함되므로 서버 위치의 영향을 받습니다. 주 테스트 서버는 Google Cloud의 us-central1-a 영역에 있어 제공업체의 서버 위치에 따라 일부 제공업체에 유리하거나 불리할 수 있습니다. 이러한 영향을 줄이기 위해 테스트 위치 추가를 검토하고 있습니다.
버전 기록
버전 2.2.0
2026년 3월 2일
- 프롬프트 업데이트: 더 광범위하고 다양한 콘텐츠 및 더 폭넓은 작업 유형을 포함한 향상된 프롬프트 세트를 도입했습니다. 추측 디코딩 같은 기법으로 인해 출력 유형에 따라 출력 속도가 달라지므로 이는 중요합니다.
- 기본 워크로드 변경: 이제 사이트의 기본 속도는 입력 토큰 10k개 프롬프트(이전에는 1k개)의 결과를 반영하며, 입력 토큰 100개 워크로드의 성능 측정은 지원 중단했습니다. 입력 토큰 1k개, 10k개, 100k개 워크로드는 모든 페이지의 프롬프트 옵션 드롭다운에서 선택해 계속 볼 수 있습니다. 서로 다른 워크로드 형태의 출력 속도를 비교하는 가장 쉬운 방법은 입력 토큰 수별 출력 속도 차트를 사용하는 것입니다.
무결성 약관
배경
Artificial Analysis는 독립적인 AI 벤치마킹 및 인사이트 제공업체입니다. 수백만 명의 사용자와 조직이 당사의 벤치마크를 폭넓게 인용하고 참고합니다.
Artificial Analysis에 게시하는 모든 데이터가 공정하고 투명하며, 당사가 다루는 모델과 엔드포인트를 사용하는 개발자 및 조직의 일반적인 경험을 대표하도록 노력합니다. 당사의 추론 벤치마킹 데이터는 속도, 지연 시간, 품질 등의 차원에서 추론 제공업체를 비교하는 참고 표준으로 널리 사용됩니다. 이러한 측정값은 일반 개발자가 제공업체의 표준 공개 엔드포인트를 이용하는 경험을 반영할 때 가치가 있습니다.
본 약관은 Artificial Analysis가 추론 성능 벤치마킹을 시작한 이래 적용해 온 접근 방식을 공식화합니다. Artificial Analysis에 서버리스 엔드포인트 데이터를 게시하는 모든 추론 제공업체와 플랫폼(통칭 "제공업체")에 동일하게 적용되며, 모든 제공업체가 동일하고 공정한 기준으로 측정되도록 합니다.
제공업체 요구 사항
Artificial Analysis의 트래픽은 일반 개발자가 엔드포인트를 사용할 때 제공받는 것과 동일한 공개 구성에서 처리되어야 합니다. 특히 제공업체는 다음 행위를 해서는 안 됩니다:
- Artificial Analysis 트래픽을 감지하거나 지문을 추출하거나 다른 방식으로 식별한 후(계정, API 키, IP 주소, 요청 헤더, 페이로드 또는 트래픽 패턴을 통한 식별 포함) 일반 트래픽과 다르게 처리하는 행위
- Artificial Analysis 트래픽을 일반에 제공되지 않는 별도 하드웨어, 용량 풀, 우선순위 대기열, 지리적 리전 등 전용, 예약 또는 비공개 리소스로 라우팅하는 행위
- 동일한 이름으로 공개적으로 안내되고 일반에 제공되는 것과 다른 모델, 양자화, 컨텍스트 길이 또는 엔드포인트 구성을 Artificial Analysis에 제공하는 행위
- 동일 엔드포인트의 일반 트래픽에 적용되는 설정을 대표하지 않는 배치 크기, 동시성 또는 부하 구성으로 Artificial Analysis 트래픽을 처리하는 행위(예: 요청당 속도를 높이기 위해 벤치마크 요청을 더 작은 배치 크기로 실행)
요청이 있을 경우 제공업체는 Artificial Analysis 트래픽을 처리하는 모델 버전, 정밀도 또는 양자화, 컨텍스트 길이를 확인하고 이것이 표준 공개 상품과 일치함을 확인해야 합니다. 제공업체는 엔드포인트가 Artificial Analysis에서 측정되고 있음을 아는 모든 직원, 계약업체, 고문 또는 계열사가 이 정책을 준수하도록 해야 합니다.
표준 공개 상품의 일부이며 모든 개발자가 동등한 조건으로 사용할 수 있는 성능 기능(예: 자동 확장, 일반에 제공되는 캐싱 또는 모든 고객이 이용할 수 있도록 공개된 티어링)은 Artificial Analysis 트래픽에만 선택적으로 적용되지 않는 한 위반이 아닙니다.
준수 절차
Artificial Analysis는 독자적인 재량에 따라 엔드포인트와 제공업체를 등재합니다. 본 약관을 준수하지 않는 엔드포인트 또는 제공업체의 등재를 취소하고, 어떤 이유로든 등재를 거부하거나 보류하거나 삭제할 권리를 보유합니다.
측정하는 모든 엔드포인트에 대해 일관성을 자주 확인합니다. 표준 관행에 따라 주 Artificial Analysis 계정과 독립적인 테스트 계정에서 함께 측정하며, 각 계정은 일반 개발자와 같은 방식으로 생성하고 사용합니다. 동일한 페이로드와 엔드포인트에서 중대한 차이가 있는 결과가 반환되면 결론을 내리기 전에 조사합니다.
Artificial Analysis 트래픽이 표준 공개 상품과 다르게 처리되고 있음을 감지하거나 합리적으로 의심하는 경우 다음 조치를 취할 수 있습니다:
- 영향을 받은 측정값의 게시를 보류, 삭제 또는 연기합니다.
- 일반에 공개된 표준 계정으로 다시 측정하고 해당 결과를 게시합니다.
- 성능 리더보드와 목록에서 해당 엔드포인트 또는 제공업체를 삭제합니다.
- 모든 리더보드에서 해당 제공업체를 정지합니다.
- 제공업체가 Artificial Analysis에 대표성 없는 성능을 제공한 사실을 공개합니다.
Artificial Analysis에 엔드포인트를 제출함으로써 제공업체는 본 약관과 벤치마크 무결성 유지에 대한 공동의 약속을 인정합니다. Artificial Analysis는 언제든지 이 정책을 업데이트할 수 있습니다.
벤치마크의 무결성을 유지하기 위한 협조에 감사드립니다. 질문이나 우려 사항이 있으면 당사 팀에 문의해 주세요.