Artificial Analysis 能力指数方法论
概述
Artificial Analysis 能力指数衡量模型在特定专业使用场景下的表现,例如法律、医疗健康或金融工作。
我们独立运行每一项组成指数的基准测试,然后再将其得分合并计入指数。与所有评测指标一样,能力指数存在局限性,未必能直接适用于每一个使用场景,但在比较模型于某一领域真正重要的工作上的表现时,它们提供了有用的综合参考。
底层的各项基准测试,包括每一项如何运行和评分,均记录在智能基准测试方法论中。
指数构成明细
每个指数针对单一职业或领域,例如法律(Legal)、医疗与医学(Healthcare & Medical)或金融与会计(Finance & Accounting),并根据各项能力在该领域真实任务中出现的频率对其加权。
我们的任务权重参考了 O*NET 风格的工作活动分类体系。下表列出了各指数的组成部分及其权重。
| 指数 | 权重 | 能力 | 评测 | 说明 |
|---|---|---|---|---|
| 财务与会计指数 | 30% | 商业知识 | AA-Omniscience | 会计、公司财务、经济学和投资方面的领域知识。 |
| 30% | 智能体知识工作 | GDPval-AA v2.1, AA-Briefcase v1.1 | 使用工具、制定计划并执行多步骤任务,例如制作电子表格、开展分析或协调工作流。 | |
| 20% | 推理 | HLE | 用于敏感性分析、估值和结构化问题解决的多步骤定量与分析推理。 | |
| 10% | 智能体工具使用 | AutomationBench-AA | 在不违反安全规则的情况下,通过电子表格、电子邮件、会计工具等商业应用完成财务工作流。 | |
| 5% | 长上下文 | LCR, GDP.pdf | 阅读长篇财务披露、交易文件和 PDF 报告并进行推理。 | |
| 5% | 避免幻觉 | AA-Omniscience | 避免编造数字或引文。 | |
| 战略与运营指数 | 30% | 商业知识 | AA-Omniscience | 对业务流程、会计基础和运营概念的实用知识。 |
| 35% | 智能体知识工作 | GDPval-AA v2.1, AA-Briefcase v1.1 | 使用工具、制定计划并端到端协调多步骤办公工作流。 | |
| 30% | 智能体工具使用 | AutomationBench-AA | 在不违反安全规则的情况下,通过商业应用完成运营、人力资源、营销、销售和支持工作流。 | |
| 5% | 长上下文 | LCR, GDP.pdf | 在长篇对话、政策、记录和 PDF 文档中保持上下文。 | |
| 法律指数 | 35% | 法律知识 | AA-Omniscience | 对不同司法辖区的法律、法理和程序的掌握。 |
| 25% | 智能体知识工作 | GDPval-AA v2.1, AA-Briefcase v1.1 | 执行案件管理工作流、起草流程和工具辅助研究。 | |
| 15% | 推理 | HLE | 多步骤论证、法律解释以及对相互冲突的权威进行权衡。 | |
| 10% | 长上下文 | LCR, GDP.pdf | 阅读并综合合同、证据开示材料、判例资料和 PDF 诉讼文件。 | |
| 10% | 避免幻觉 | AA-Omniscience | 避免编造判例引文或法律条文。 | |
| 5% | 智能体工具使用 | AutomationBench-AA | 在不违反安全规则的情况下,通过商业应用完成客户支持和运营工作流。 | |
| 医疗与健康指数 | 30% | 医疗与健康知识 | AA-Omniscience | 涵盖诊断、药理学和护理路径的临床知识。 |
| 25% | 智能体知识工作 | GDPval-AA v2.1, AA-Briefcase v1.1 | 使用工具、制定计划并端到端协调电子健康记录与药房工作流。 | |
| 15% | 长上下文推理 | MLCR-AA | 综合长篇、分散的患者记录和理赔文件中的发现。 | |
| 10% | 避免幻觉 | AA-Omniscience | 避免编造药物相互作用、剂量或指南。 | |
| 10% | 推理 | HLE | 跨生物学和医学的多步骤临床推理。 | |
| 10% | 智能体工具使用 | AutomationBench-AA | 在不违反安全规则的情况下,通过商业应用完成患者支持和运营工作流。 | |
| 工程指数 | 35% | 工程知识 | AA-Omniscience | 土木、电气、机械及其他工程学科的领域知识。 |
| 30% | 推理 | HLE, CritPt | 用于推导、尺寸计算和设计权衡的多步骤定量推理。 | |
| 20% | 智能体知识工作 | GDPval-AA v2.1, AA-Briefcase v1.1 | 使用工具、制定计划并分多步完成工程交付成果。 | |
| 15% | 智能体终端使用 | Terminal-Bench 4.0 | 操作真实终端环境以执行构建、脚本、系统管理和调试。 | |
| 经济学指数 | 35% | 经济学知识 | AA-Omniscience | 微观经济学、宏观经济学、公共财政和市场方面的知识。 |
| 35% | 推理 | HLE | 用于建模、估计和推断的多步骤定量与分析推理。 | |
| 25% | 智能体知识工作 | GDPval-AA v2.1, AA-Briefcase v1.1 | 使用工具、制定计划并分多步完成分析交付成果。 | |
| 5% | 长上下文推理 | LCR | 阅读长篇报告、数据集和研究笔记并进行推理。 |