Endpoint Accuracy Index v1.0 방법론
Endpoint Accuracy Index v1.0
Endpoint Accuracy Index는 동일한 특정 모델을 제공하는 여러 API 제공업체에 따라 모델의 지능과 역량이 어떻게 달라지는지 측정합니다. 서로 다른 제공업체에서 제공하는 같은 모델도 양자화, 샘플링 기본값, 컨텍스트 처리, 토큰 제한, 프롬프트 파서 및 기타 엔드포인트 측 설정에 따라 다르게 동작할 수 있습니다. 이를 포착하기 위해 각 제공업체 엔드포인트에서 고정된 평가 스위트를 다시 실행하고, 엔드포인트가 모델의 정확도를 얼마나 가깝게 재현하는지 표시합니다.
자체 호스팅한 모델 배포를 기준선으로도 사용하며, 각 제공업체 엔드포인트의 전체 정확도 점수를 기준 배포 대비 백분율로 나타냅니다. 지수에서 100%는 엔드포인트가 참조와 일치한다는 뜻이며, 점수가 낮을수록 기준선보다 정확도가 낮다는 의미입니다.
각 결과의 통계적 유의성을 표시합니다. 엔드포인트별 결과에는 반복 실행 간 변동으로 계산한 95% 신뢰 구간이 포함되며, 엔드포인트가 통계적으로 참조 범위 내에 있는지 또는 참조보다 유의하게 낮은지를 표시합니다. 결과에 영향을 준 특정 특성이나 결함이 나타난 엔드포인트에는 각각 관련 노트도 제공합니다.
결과는 실시간 모니터링이 아니라 특정 시점의 스냅샷입니다. 각 결과에는 날짜와 사용된 반복 횟수가 표시되므로 맥락에 맞게 해석할 수 있습니다.
평가 스위트
각 엔드포인트는 네이티브 도구 사용, 고난도 추론, 긴 컨텍스트 회상을 아우르는 세 가지 평가로 구성된 고정 스위트에서 평가합니다. 신뢰 구간을 좁게 유지하도록 평가별 반복 횟수를 정하며, 각 결과와 함께 그 결과에 사용된 반복 횟수를 표시합니다.
Endpoint Accuracy Index v1.0 스위트입니다. 이전 버전, 전체 버전, 실험 버전은 스위트에 포함되지 않습니다.
| 평가 | 분야 | 하위 집합 | 반복 횟수 | 가중치 | 점수 산정 |
|---|---|---|---|---|---|
| BFCL v4-500 | 도구 / 함수 호출 | Berkeley Function Calling Leaderboard의 500개 작업 하위 집합 | 3 | 33% | 네이티브 도구 호출 실행 및 일치 여부, 반복 실행의 평균 정확도 |
| HLE-250 | 고난도 추론 | Humanity's Last Exam의 250개 문항 하위 집합 | 10 | 33% | 동등성 검사 LLM, 반복 실행의 평균 정확도 |
| AA-LCR-25 | 긴 컨텍스트 회상 | Artificial Analysis Long Context Reasoning의 25개 문항 하위 집합 | 10 | 33% | 동등성 검사 LLM, 반복 실행의 평균 정확도 |
평가 데이터세트
BFCL v4-500: 도구 / 함수 호출
- 측정 대상: BFCL(Berkeley Function Calling Leaderboard)은 단순, 병렬, 다중, 멀티턴 호출과 무관성 감지(도구를 호출하지 않아야 할 때를 아는 능력)를 통해 모델이 네이티브 도구 / 함수 호출을 얼마나 안정적으로 사용하는지 평가합니다. 멀티턴 및 병렬 범주처럼 평가에서 가장 어려운 부분에 더 높은 비중을 둔 500개 작업의 오프라인 전용 하위 집합을 실행합니다. 이미 성능이 포화되었거나 리소스 사용량이 많거나 변별력이 낮은 범주(Java/JS, 메모리, 웹 검색, 실시간 관련성)는 BFCL v4-500 하위 집합에서 제외합니다. 2026.3.23 버전을 사용합니다.
- 하위 집합 및 반복 횟수: Berkeley Function Calling Leaderboard의 500개 작업 하위 집합, 3회 반복 실행.
- 점수 산정: 네이티브 도구 호출 실행 및 일치 여부, 반복 실행의 평균 정확도.
- 참조: https://gorilla.cs.berkeley.edu/leaderboard.html
- 일부 엔드포인트가 실패할 수 있는 이유: 도구 제한, 도구 스키마 파싱 및 반환 형식 지정, 컨텍스트 제한.
HLE-250: 고난도 추론
- 측정 대상: Humanity's Last Exam(HLE)은 수학, 자연과학, 인문학 전반에서 전문가가 작성한 어려운 문항으로 구성된 최첨단 학술 벤치마크입니다. 전체 데이터세트에서 더 어렵고 까다로운 문항에 더 높은 비중을 둔 텍스트 전용 250개 문항 하위 집합을 실행합니다. 전체 버전은 Artificial Analysis Intelligence Index의 일부로 실행합니다.
- 하위 집합 및 반복 횟수: Humanity's Last Exam의 250개 문항 하위 집합, 10회 반복 실행.
- 점수 산정: 동등성 검사 LLM, 반복 실행의 평균 정확도.
- 참조: https://huggingface.co/datasets/cais/hle
- 일부 엔드포인트가 실패할 수 있는 이유: 컨텍스트 및 출력 토큰 제한/잘림, 추론 노력 제한, 양자화 및 추론 정밀도.
AA-LCR-25: 긴 컨텍스트 회상
- 측정 대상: AA-LCR(Artificial Analysis Long Context Reasoning)은 여러 긴 문서(문항당 입력 토큰 약 100k개)에 걸친 추론을 테스트합니다. 전체 데이터세트에서 더 어렵고 까다로운 문항에 더 높은 비중을 둔 25개 문항 하위 집합을 실행합니다. 전체 버전은 Artificial Analysis Intelligence Index의 일부로 실행합니다.
- 하위 집합 및 반복 횟수: Artificial Analysis Long Context Reasoning의 25개 문항 하위 집합, 10회 반복 실행.
- 점수 산정: 동등성 검사 LLM, 반복 실행의 평균 정확도.
- 일부 엔드포인트가 실패할 수 있는 이유: 컨텍스트 창 제한, 입력 잘림, 빈 응답.
점수 산정
각 평가는 반복 실행의 평균 정확도를 산출합니다. 종합 Endpoint Accuracy Index는 세 평가 점수를 가중 혼합하고 0~100 척도로 정규화한 값입니다.
각 평가의 평균 정확도(0~1)에 가중치를 곱하고 전체 가중치로 나눕니다. 세 평가에는 동일한 가중치(33% / 33% / 33%)가 적용됩니다. 세 평가 모두 엔드포인트에 대한 현재 버전 결과가 있을 때만 종합 점수를 계산합니다.
자체 호스팅한 참조 엔드포인트가 있는 경우 평가별 비율에 동일한 가중 혼합을 적용하여 평가별 점수와 종합 점수를 모두 해당 참조 대비 백분율로 나타냅니다.
각 엔드포인트의 점수는 자체 불확실성과 참조의 불확실성을 결합한 95% 신뢰 구간과 함께 참조 대비 백분율로 표시됩니다. 반복 실행 간 변동에 양측 95% 스튜던트 t 검정을 적용하여 구간을 만들고, 세 평가를 제곱합 제곱근 방식으로 결합한 뒤, 결과를 참조(100%)와 비교합니다.
- 범위 내: 신뢰 구간에 참조가 포함되므로 통계적으로 구분할 수 없습니다.
- 범위를 유의하게 벗어남: 신뢰 구간이 참조에서 완전히 벗어나므로 통계적으로 유의한 차이가 있습니다.
각 엔드포인트의 정확한 점수와 신뢰 구간은 차트에 표시됩니다.
0~1의 원시 점수는 데이터 계층에 그대로 유지하고 표시할 때만 100을 곱합니다. 각 엔드포인트에서 평가별로 가장 최근 실행을 사용합니다. 실행이 여러 개라면 가장 최근 실행을 우선하며, 날짜가 같으면 오류가 발생한 작업 수가 가장 적은 실행을 사용합니다.
추론 매개변수
평가 하네스가 아닌 엔드포인트의 차이를 반영하도록 표준화된 설정으로 엔드포인트를 평가합니다.
- 샘플링: 모든 엔드포인트에 표준화된 샘플링 기본값을 일관되게 적용합니다. 모델 개발사가 온도를 지정한 경우 권장 온도를 사용하고, 그렇지 않은 경우 Artificial Analysis Intelligence Index의 접근 방식과 동일하게 추론 모델에는 0.6을 사용합니다.
- 추론: 엔드포인트가 지원하는 가장 높은 추론 모드를 사용합니다.
- 도구 호출: API 기본값을 사용하고, 도구 선택은 auto로 설정하며 엄격한 스키마 준수를 활성화합니다. 엔드포인트가 이러한 설정 중 하나를 지원하지 않는 경우 해당 엔드포인트에서 지원하는 가장 가까운 설정을 사용합니다.
- 스트리밍: 기준선에서는 스트리밍을 활성화합니다. 스트리밍을 지원하지 않는 엔드포인트는 스트리밍을 비활성화하여 실행합니다.
- 출력 및 컨텍스트: 엔드포인트가 지원하는 최대 출력 토큰 수와 컨텍스트 창을 사용합니다.
참조 실행 및 재현성
각 모델의 참조 실행은 일반적으로 vLLM 또는 SGLang을 사용하는 자체 호스팅 모델 배포입니다. 모델 개발사와 서빙 프레임워크에서 권장하는 설정(예: vLLM 레시피 또는 SGLang 쿡북 사용)으로 서버를 구성하고, 모델 추론에 권장되는 가장 높은 정밀도 설정으로 제공합니다. 서빙 프레임워크 및 CUDA 버전, 모델 가중치 정보, 실행 인수 등 주요 구성 세부 정보는 기록하여 결과와 함께 표시합니다. 참조 실행 결과의 노트 요소와 아래에서 확인할 수 있습니다.
시간이 지나도 엔드포인트 간 결과를 비교할 수 있도록 평가 스위트의 버전을 고정합니다.
DeepSeek V4 Pro
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.12 (Docker image: lmsysorg/sglang:deepseek-v4-blackwell)
- CUDA: 13.0
- Precision: native — W4A8 MoE experts (MegaMoE) + FP8 (e4m3) attention/dense
- Model weights: deepseek-ai/DeepSeek-V4-Pro on Hugging Face
Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: deepseek-v4
- tool-call-parser: deepseekv4GLM-5.2
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13 (Docker image: lmsysorg/sglang:latest)
- CUDA: 13.0
- Precision: native FP8 with DeepGEMM kernels
- Model weights: zai-org/GLM-5.2-FP8 on Hugging Face
Key SGLang launch args:
- moe-a2a-backend: deepep
- kv-cache-dtype: fp8_e4m3
- reasoning-parser: glm45
- tool-call-parser: glm47gpt-oss-120b
Reference inference setup:
- GPU: 8x NVIDIA B200
- SGLang version: 0.5.13.post1 (Docker image: lmsysorg/sglang:v0.5.13.post1)
- CUDA: 13.0
- Precision: native MXFP4 (FlashInfer MXFP4 MoE kernels) + BF16 attention/dense
- Model weights: openai/gpt-oss-120b on Hugging Face
Key SGLang launch args:
- kv-cache-dtype: bfloat16
- reasoning-parser: gpt-oss
- tool-call-parser: gpt-oss특정 시점의 결과
엔드포인트 정확도 결과는 실시간 모니터링이 아니라 날짜가 표시된 스냅샷입니다. 제공업체가 서빙 스택과 엔드포인트 설정을 업데이트함에 따라 엔드포인트는 시간이 지나면서 변경될 수 있으므로 각 결과에 측정 날짜가 표시됩니다. 정해진 주기에 따라 그리고 제공업체의 요청이 있을 때 다시 실행하며, 항상 가장 최근 결과와 그 날짜를 표시합니다.
모델 선정
동일한 모델을 제공하는 제공업체 생태계가 넓고(대개 여러 추론 제공업체가 서비스하는 오픈 웨이트 모델), 프로덕션에서 널리 사용되는 모델을 엔드포인트 정확도 벤치마킹 대상으로 우선 선정합니다. 포함되는 모델은 신규 모델과 제공업체가 추가됨에 따라 계속 바뀌는 순환 구성으로 고정되어 있지 않습니다.
현재 Endpoint Accuracy Index에서 다루는 모델은 다음과 같습니다.