지수

AA-LCR v1.1AutomationBench-AATerminal-Bench 4.0SciCodeHumanity's Last ExamGDP.pdfCritPt
Updated

Artificial Analysis Intelligence Index v4.3.2

A composite benchmark aggregating ten challenging evaluations to provide a holistic measure of AI capabilities across mathematics, science, coding, and reasoning.

AA-LCR v1.1Humanity's Last ExamAutomationBench-AAGDP.pdf

재무 및 회계 지수

비즈니스 지식, 에이전트형 지식 작업, 추론, 에이전트형 도구 사용, 장문 맥락 분석, 환각 방지를 포함해 재무 및 회계 분야의 성능을 측정합니다.

금융비즈니스에이전트지식 업무추론도구 사용긴 컨텍스트충실성
AA-LCR v1.1AutomationBench-AAGDP.pdf

전략 및 운영 지수

비즈니스 지식, 에이전트형 지식 작업, 비즈니스 앱에서의 에이전트형 도구 사용, 장문 맥락 분석을 포함해 전략 및 운영 분야의 성능을 측정합니다.

비즈니스에이전트지식 업무도구 사용긴 컨텍스트
AA-LCR v1.1Humanity's Last ExamGDP.pdfAutomationBench-AA

법률 지수

법률 지식, 에이전트형 지식 작업, 추론, 장문 맥락 문서 분석, 환각 방지, 에이전트형 도구 사용을 포함해 법률 분야의 성능을 측정합니다.

법률에이전트지식 업무추론긴 컨텍스트충실성도구 사용
AA-Briefcase v1.1MLCR-AAHumanity's Last ExamAutomationBench-AA

의료 및 헬스케어 지수

임상 지식, 에이전트형 지식 작업, 환자 기록에 대한 장문 맥락 추론, 환각 방지, 임상 추론, 에이전트형 도구 사용을 포함해 의료 및 헬스케어 분야의 성능을 측정합니다.

의료에이전트지식 업무긴 컨텍스트충실성추론도구 사용
AA-Briefcase v1.1Humanity's Last ExamCritPtTerminal-Bench 4.0

공학 지수

공학 지식, 정량적 추론, 에이전트형 실행, 터미널 사용을 포함해 공학 분야의 성능을 측정합니다.

과학추론에이전트지식 업무코딩
AA-LCR v1.1Humanity's Last Exam

경제학 지수

경제학 지식, 정량적 추론, 에이전트형 실행, 장문 맥락 분석을 포함해 경제학 분야의 성능을 측정합니다.

비즈니스추론에이전트지식 업무긴 컨텍스트