Artificial Analysis 역량 지수 방법론
개요
Artificial Analysis 역량 지수는 법률, 의료, 금융 업무처럼 특정 전문 사용 사례에서 모델이 얼마나 뛰어난 성능을 보이는지 측정합니다.
지수를 구성하는 모든 벤치마크를 독립적으로 실행한 후 그 점수를 지수로 결합합니다. 모든 평가 지표와 마찬가지로 역량 지수에는 한계가 있으며 모든 사용 사례에 직접 적용되지는 않을 수 있지만, 특정 분야에서 중요한 업무를 기준으로 모델을 비교하는 데 유용한 종합 정보를 제공합니다.
각 기반 벤치마크의 실행 및 채점 방법은 지능 벤치마킹 방법론에 설명되어 있습니다.
지수 구성 분석
각 지수는 법률, 의료 및 보건, 금융 및 회계 같은 하나의 직업 또는 분야를 대상으로 하며, 해당 분야의 실제 업무에서 각 역량이 나타나는 빈도에 따라 일련의 역량에 가중치를 부여합니다.
업무 가중치는 O*NET 방식의 업무 활동 분류 체계를 바탕으로 합니다. 아래 표는 각 지수의 구성 요소와 가중치를 보여 줍니다.
| 지수 | 가중치 | 역량 | 평가 | 설명 |
|---|---|---|---|---|
| 재무 및 회계 지수 | 30% | 비즈니스 지식 | AA-Omniscience | 회계, 기업 재무, 경제학, 투자에 관한 전문 지식 |
| 30% | 에이전트형 지식 작업 | GDPval-AA v2.1, AA-Briefcase v1.1 | 스프레드시트 작성, 분석 실행, 워크플로 조정과 같은 도구 사용, 계획, 다단계 작업 수행 | |
| 20% | 추론 | HLE | 민감도 분석, 가치 평가, 구조화된 문제 해결에 쓰이는 다단계 정량 및 분석 추론 | |
| 10% | 에이전트형 도구 사용 | AutomationBench-AA | 가드레일을 위반하지 않고 스프레드시트, 이메일, 회계 도구 같은 비즈니스 앱에서 재무 워크플로를 완료하는 능력 | |
| 5% | 장문 맥락 | LCR, GDP.pdf | 긴 재무 공시, 거래 문서, PDF 보고서를 읽고 추론하는 능력 | |
| 5% | 환각 방지 | AA-Omniscience | 조작된 수치나 인용을 피하는 능력 | |
| 전략 및 운영 지수 | 30% | 비즈니스 지식 | AA-Omniscience | 비즈니스 프로세스, 회계 기초, 운영 개념에 관한 실무 지식 |
| 35% | 에이전트형 지식 작업 | GDPval-AA v2.1, AA-Briefcase v1.1 | 도구 사용, 계획, 다단계 사무 워크플로의 전체 조정 | |
| 30% | 에이전트형 도구 사용 | AutomationBench-AA | 가드레일을 위반하지 않고 비즈니스 앱에서 운영, 인사, 마케팅, 영업, 지원 워크플로를 완료하는 능력 | |
| 5% | 장문 맥락 | LCR, GDP.pdf | 긴 대화, 정책, 기록, PDF 문서 전반에서 맥락을 유지하는 능력 | |
| 법률 지수 | 35% | 법률 지식 | AA-Omniscience | 여러 관할권의 법령, 법리, 절차에 관한 지식 |
| 25% | 에이전트형 지식 작업 | GDPval-AA v2.1, AA-Briefcase v1.1 | 사건 관리 워크플로, 문서 작성 과정, 도구 지원 조사의 수행 | |
| 15% | 추론 | HLE | 다단계 논증, 법령 해석, 상충하는 권위의 비교 평가 | |
| 10% | 장문 맥락 | LCR, GDP.pdf | 계약서, 증거개시 자료, 판례 묶음, PDF 제출 문서를 읽고 종합하는 능력 | |
| 10% | 환각 방지 | AA-Omniscience | 조작된 판례 인용이나 법령을 피하는 능력 | |
| 5% | 에이전트형 도구 사용 | AutomationBench-AA | 가드레일을 위반하지 않고 비즈니스 앱에서 고객 지원 및 운영 워크플로를 완료하는 능력 | |
| 의료 및 헬스케어 지수 | 30% | 의료 및 건강 지식 | AA-Omniscience | 진단, 약리학, 치료 경로에 관한 임상 지식 |
| 25% | 에이전트형 지식 작업 | GDPval-AA v2.1, AA-Briefcase v1.1 | 도구 사용, 계획, 전자건강기록 및 약국 워크플로의 전체 조정 | |
| 15% | 장문 맥락 추론 | MLCR-AA | 길고 분절된 환자 기록과 청구 파일에서 발견 사항을 종합하는 능력 | |
| 10% | 환각 방지 | AA-Omniscience | 조작된 약물 상호작용, 용량, 지침을 피하는 능력 | |
| 10% | 추론 | HLE | 생물학과 의학에 걸친 다단계 임상 추론 | |
| 10% | 에이전트형 도구 사용 | AutomationBench-AA | 가드레일을 위반하지 않고 비즈니스 앱에서 환자 지원 및 운영 워크플로를 완료하는 능력 | |
| 공학 지수 | 35% | 공학 지식 | AA-Omniscience | 토목, 전기, 기계 및 기타 공학 분야에 관한 전문 지식 |
| 30% | 추론 | HLE, CritPt | 유도, 치수 계산, 설계 절충을 위한 다단계 정량 추론 | |
| 20% | 에이전트형 지식 작업 | GDPval-AA v2.1, AA-Briefcase v1.1 | 공학 산출물을 위한 도구 사용, 계획, 다단계 실행 | |
| 15% | 에이전트형 터미널 사용 | Terminal-Bench 4.0 | 빌드, 스크립트, 시스템 관리, 디버깅을 위해 실제 터미널 환경을 조작하는 능력 | |
| 경제학 지수 | 35% | 경제학 지식 | AA-Omniscience | 미시경제학, 거시경제학, 공공재정, 시장에 관한 지식 |
| 35% | 추론 | HLE | 모델링, 추정, 추론을 위한 다단계 정량 및 분석 추론 | |
| 25% | 에이전트형 지식 작업 | GDPval-AA v2.1, AA-Briefcase v1.1 | 분석 산출물을 위한 도구 사용, 계획, 다단계 실행 | |
| 5% | 장문 맥락 추론 | LCR | 긴 보고서, 데이터 세트, 연구 노트를 읽고 추론하는 능력 |