Artificial Analysis 벤치마킹 방법론

범위

Artificial Analysis는 AI 모델, 추론 API 엔드포인트 및 시스템의 지능, 품질, 성능, 가격을 벤치마킹합니다. 웹사이트의 이 섹션에서는 품질 벤치마킹과 성능 벤치마킹을 포함한 벤치마킹 방법론을 설명합니다.

언어 모델 벤치마킹에서는 고객이 시스템 이용에 고정 요금을 지불하지 않고 사용량에 대해서만 지불하는 엔드포인트를 서버리스로 간주합니다. 일반적으로 이는 엔드포인트 가격이 토큰 단위로 책정되며, 입력 토큰과 출력 토큰의 가격이 서로 다른 경우가 많다는 뜻입니다.

모든 모달리티에서 성능 벤치마킹은 AI 추론 서비스와 시스템 고객이 경험하는 종단 간 성능을 측정합니다. 따라서 벤치마크 결과는 특정 하드웨어 플랫폼에서 가능한 최대 성능을 나타내기 위한 것이 아니라, 고객이 여러 제공업체에서 경험하는 실제 성능을 나타내기 위한 것입니다.

독점 모델과 오픈 웨이트 모델을 모두 벤치마킹합니다.

방법론 세부 정보

용어 정의

이 페이지와 Artificial Analysis 웹사이트 전반에서 다음 용어를 사용합니다.

  • 모델: 독점 모델, 오픈 소스 모델, 오픈 웨이트 모델을 포함한 대규모 언어 모델(LLM)입니다.
  • 모델 개발사: 모델을 개발하고 훈련한 조직입니다. 예를 들어 OpenAI는 GPT-4의 개발사이고 Meta는 Llama 3의 개발사입니다.
  • 엔드포인트: API를 통해 액세스할 수 있도록 호스팅된 모델 인스턴스입니다. 하나의 모델에 여러 제공업체의 엔드포인트가 있을 수 있습니다.
  • 시스템: AI 모델을 실행하는 전용 컴퓨팅 환경입니다. 일반적으로 VM처럼 프로비저닝된 인프라이며, 부하가 걸린 상태의 성능을 벤치마킹할 수 있습니다.
  • 제공업체: 하나 이상의 모델 엔드포인트나 시스템을 호스팅하고 이에 대한 액세스를 제공하는 회사입니다. OpenAI, AWS Bedrock, Together.ai 등이 있습니다. 한 회사가 모델 개발사이면서 제공업체인 경우가 많습니다.
  • 서버리스: 사용량에 따라 제공되는 클라우드 서비스입니다. LLM 추론 API의 경우 일반적으로 입력 및 출력 토큰당 가격이 책정된다는 뜻입니다. 서버리스 클라우드 제품도 실제로는 서버에서 실행됩니다!
  • 오픈 웨이트: 개발사가 가중치를 공개한 모델입니다. 많은 오픈 LLM이 오픈 소스 소프트웨어의 완전한 정의를 충족하지 않는 라이선스로 공개되었으므로 '오픈 소스' 대신 '오픈 웨이트' 또는 간단히 '오픈' 모델이라고 부릅니다.
  • 토큰: 최신 LLM은 단어와 문자를 수치로 표현한 토큰을 중심으로 구축됩니다. LLM은 토큰을 입력으로 받아 토큰을 출력으로 생성합니다. 입력 텍스트는 토크나이저를 통해 토큰으로 변환됩니다. LLM마다 서로 다른 토크나이저를 사용합니다.
  • OpenAI 토큰: OpenAI의 GPT-3.5 및 GPT-4 토크나이저가 생성하는 토큰입니다. Artificial Analysis 벤치마킹에서는 일반적으로 Python용 OpenAI tiktoken 패키지(o200k_base 토크나이저)로 측정합니다. 모델 간 공정한 비교를 위해 Artificial Analysis 전반에서 OpenAI 토큰을 표준 측정 단위로 사용합니다. 모든 '초당 토큰 수' 지표는 OpenAI 토큰을 기준으로 합니다.
  • 네이티브 토큰: LLM 자체 토크나이저가 생성하는 토큰입니다. 'OpenAI 토큰'과 구분하기 위해 '네이티브 토큰'이라고 부릅니다. 가격은 일반적으로 네이티브 토큰을 기준으로 합니다.
  • 가격(입력/출력): 모델로 전송한 입력 토큰과 모델에서 받은 출력 토큰에 대해 제공업체가 토큰당 청구하는 가격입니다. 표시된 가격은 제공업체가 현재 게시한 가격입니다.
  • 가격(혼합): 보다 쉽게 비교할 수 있도록 캐시 적중, 입력, 출력 토큰의 비율을 7:2:1로 가정해 혼합 가격을 계산합니다.
  • 작업당 비용: Artificial Analysis Intelligence Index 작업 하나를 완료하는 데 드는 가중 평균 비용(USD)입니다. 워크로드 전체에서 사용된 입력, 캐시 및 출력 토큰 수에 각 가격을 곱하고 Intelligence Index에서 사용하는 것과 동일한 벤치마크별 가중치를 적용한 다음, 작업 수로 나누어 계산합니다. 가격은 제공업체의 자체 API 요금 또는 모든 제공업체 가격의 중앙값을 사용합니다. 캐싱 비용은 제공업체마다 다릅니다. 비용은 실제 토큰 사용량을 반영하므로 토큰당 가격이 같더라도 더 긴 답변이나 더 많은 추론 토큰을 생성하는 모델은 작업당 비용이 더 높습니다.

    여기서 i = Artificial Analysis Intelligence Index의 각 벤치마크이고, w = Index에서 해당 벤치마크의 가중치

  • 첫 토큰까지 걸린 시간: 서비스 또는 시스템에 요청을 보낸 시점부터 응답의 첫 토큰을 받은 시점까지의 시간(초)입니다. 추론 토큰을 반환하는 추론 모델에서는 첫 추론 토큰이 이에 해당합니다.
  • 첫 답변 토큰까지 걸린 시간: 서비스 또는 시스템에 요청을 보낸 시점부터 응답의 첫 답변 토큰을 받은 시점까지의 시간(초)입니다. 추론 모델에서는 '사고' 시간이 모두 끝난 뒤부터 측정합니다.
  • 출력 속도(초당 출력 토큰 수): 첫 토큰을 받은 후 초당 수신한 평균 토큰 수입니다.
  • 출력 토큰 100개의 총 응답 시간: 출력 토큰 100개를 생성하는 데 걸리는 시간(초)으로, 비교 효용을 극대화하기 위해 TTFT와 출력 속도를 바탕으로 종합적으로 계산합니다.
  • 종단 간 응답 시간: 입력 처리 시간, 모델 추론 시간, 답변 생성 시간을 포함하여 완전한 응답을 받기까지 걸리는 총시간입니다.
  • 평균 추론 토큰 수: 추론 모델이 답변을 제공하기 전에 '추론' 토큰을 출력하는 데 사용하는 시간입니다. 다양한 프롬프트 60개에서 생성된 평균 '추론' 토큰 수를 바탕으로 계산합니다. 평균 추론 토큰 수를 확인할 수 없거나 아직 계산하지 않은 경우 추론 토큰 2k개로 가정합니다. 프롬프트 길이는 다양하며 개인 관련 질의, 상업 관련 질의, 코딩, 수학, 과학 등 여러 주제를 다룹니다. Artificial Analysis가 작성한 프롬프트와 MMLU Pro, AIME 2025, LiveCodeBench 평가에서 가져온 프롬프트를 함께 사용합니다. 이 프롬프트는 여기에서 확인할 수 있습니다.