Artificial Analysis 能力指数方法论

概述

Artificial Analysis 能力指数衡量模型在特定专业使用场景下的表现,例如法律、医疗健康或金融工作。

我们独立运行每一项组成指数的基准测试,然后再将其得分合并计入指数。与所有评测指标一样,能力指数存在局限性,未必能直接适用于每一个使用场景,但在比较模型于某一领域真正重要的工作上的表现时,它们提供了有用的综合参考。

底层的各项基准测试,包括每一项如何运行和评分,均记录在智能基准测试方法论中。

指数构成明细

每个指数针对单一职业或领域,例如法律(Legal)、医疗与医学(Healthcare & Medical)或金融与会计(Finance & Accounting),并根据各项能力在该领域真实任务中出现的频率对其加权。

我们的任务权重参考了 O*NET 风格的工作活动分类体系。下表列出了各指数的组成部分及其权重。

指数权重能力评测说明
财务与会计指数30%商业知识AA-Omniscience会计、公司财务、经济学和投资方面的领域知识。
30%智能体知识工作GDPval-AA v2.1, AA-Briefcase v1.1使用工具、制定计划并执行多步骤任务,例如制作电子表格、开展分析或协调工作流。
20%推理HLE用于敏感性分析、估值和结构化问题解决的多步骤定量与分析推理。
10%智能体工具使用AutomationBench-AA在不违反安全规则的情况下,通过电子表格、电子邮件、会计工具等商业应用完成财务工作流。
5%长上下文LCR, GDP.pdf阅读长篇财务披露、交易文件和 PDF 报告并进行推理。
5%避免幻觉AA-Omniscience避免编造数字或引文。
战略与运营指数30%商业知识AA-Omniscience对业务流程、会计基础和运营概念的实用知识。
35%智能体知识工作GDPval-AA v2.1, AA-Briefcase v1.1使用工具、制定计划并端到端协调多步骤办公工作流。
30%智能体工具使用AutomationBench-AA在不违反安全规则的情况下,通过商业应用完成运营、人力资源、营销、销售和支持工作流。
5%长上下文LCR, GDP.pdf在长篇对话、政策、记录和 PDF 文档中保持上下文。
法律指数35%法律知识AA-Omniscience对不同司法辖区的法律、法理和程序的掌握。
25%智能体知识工作GDPval-AA v2.1, AA-Briefcase v1.1执行案件管理工作流、起草流程和工具辅助研究。
15%推理HLE多步骤论证、法律解释以及对相互冲突的权威进行权衡。
10%长上下文LCR, GDP.pdf阅读并综合合同、证据开示材料、判例资料和 PDF 诉讼文件。
10%避免幻觉AA-Omniscience避免编造判例引文或法律条文。
5%智能体工具使用AutomationBench-AA在不违反安全规则的情况下,通过商业应用完成客户支持和运营工作流。
医疗与健康指数30%医疗与健康知识AA-Omniscience涵盖诊断、药理学和护理路径的临床知识。
25%智能体知识工作GDPval-AA v2.1, AA-Briefcase v1.1使用工具、制定计划并端到端协调电子健康记录与药房工作流。
15%长上下文推理MLCR-AA综合长篇、分散的患者记录和理赔文件中的发现。
10%避免幻觉AA-Omniscience避免编造药物相互作用、剂量或指南。
10%推理HLE跨生物学和医学的多步骤临床推理。
10%智能体工具使用AutomationBench-AA在不违反安全规则的情况下,通过商业应用完成患者支持和运营工作流。
工程指数35%工程知识AA-Omniscience土木、电气、机械及其他工程学科的领域知识。
30%推理HLE, CritPt用于推导、尺寸计算和设计权衡的多步骤定量推理。
20%智能体知识工作GDPval-AA v2.1, AA-Briefcase v1.1使用工具、制定计划并分多步完成工程交付成果。
15%智能体终端使用Terminal-Bench 4.0操作真实终端环境以执行构建、脚本、系统管理和调试。
经济学指数35%经济学知识AA-Omniscience微观经济学、宏观经济学、公共财政和市场方面的知识。
35%推理HLE用于建模、估计和推断的多步骤定量与分析推理。
25%智能体知识工作GDPval-AA v2.1, AA-Briefcase v1.1使用工具、制定计划并分多步完成分析交付成果。
5%长上下文推理LCR阅读长篇报告、数据集和研究笔记并进行推理。