指数

AA-LCR v1.1AutomationBench-AATerminal-Bench 4.0SciCodeHumanity's Last ExamGDP.pdfCritPt
Updated

Artificial Analysis Intelligence Index v4.3.2

A composite benchmark aggregating ten challenging evaluations to provide a holistic measure of AI capabilities across mathematics, science, coding, and reasoning.

AA-LCR v1.1Humanity's Last ExamAutomationBench-AAGDP.pdf

财务与会计指数

衡量模型在财务与会计领域的表现,包括商业知识、智能体知识工作、推理、智能体工具使用、长上下文分析和避免幻觉。

金融商业智能体知识工作推理工具使用长上下文忠实性
AA-LCR v1.1AutomationBench-AAGDP.pdf

战略与运营指数

衡量模型在战略与运营领域的表现,包括商业知识、智能体知识工作、跨商业应用的智能体工具使用和长上下文分析。

商业智能体知识工作工具使用长上下文
AA-LCR v1.1Humanity's Last ExamGDP.pdfAutomationBench-AA

法律指数

衡量模型在法律领域的表现,包括法律知识、智能体知识工作、推理、长上下文文档分析、避免幻觉和智能体工具使用。

法律智能体知识工作推理长上下文忠实性工具使用
AA-Briefcase v1.1MLCR-AAHumanity's Last ExamAutomationBench-AA

医疗与健康指数

衡量模型在医疗与健康领域的表现,包括临床知识、智能体知识工作、患者记录的长上下文推理、避免幻觉、临床推理和智能体工具使用。

医疗智能体知识工作长上下文忠实性推理工具使用
AA-Briefcase v1.1Humanity's Last ExamCritPtTerminal-Bench 4.0

工程指数

衡量模型在工程领域的表现,包括工程知识、定量推理、智能体执行和终端使用。

科学推理智能体知识工作编程
AA-LCR v1.1Humanity's Last Exam

经济学指数

衡量模型在经济学领域的表现,包括经济学知识、定量推理、智能体执行和长上下文分析。

商业推理智能体知识工作长上下文