Artificial Analysis 能力指数方法论

概述

Artificial Analysis 能力指数衡量模型在特定专业使用场景下的表现,例如法律、医疗健康或金融工作。

我们独立运行每一项组成指数的基准测试,然后再将其得分合并计入指数。与所有评测指标一样,能力指数存在局限性,未必能直接适用于每一个使用场景,但在比较模型于某一领域真正重要的工作上的表现时,它们提供了有用的综合参考。

底层的各项基准测试,包括每一项如何运行和评分,均记录在智能基准测试方法论中。

指数构成明细

每个指数针对单一职业或领域,例如法律(Legal)、医疗与医学(Healthcare & Medical)或金融与会计(Finance & Accounting),并根据各项能力在该领域真实任务中出现的频率对其加权。

我们的任务权重参考了 O*NET 风格的工作活动分类体系。下表列出了各指数的组成部分及其权重。

指数权重能力评测说明
Finance & Accounting Index30%Business KnowledgeAA-OmniscienceDomain recall in accounting, corporate finance, economics, and investments
30%Agentic Knowledge WorkGDPval-AA v2, AA-BriefcaseTool use, planning, and multi-step task execution, such as building spreadsheets, running an analysis, or coordinating a workflow
20%ReasoningHLEMulti-step quantitative and analytic reasoning, used for sensitivity analysis, valuation, and structured problem solving
10%Agentic Tool UseAutomationBench-AACompleting finance workflows across business apps such as spreadsheets, email, and accounting tools without breaking guardrails
5%Long-ContextLCR, GDP.pdfReading and reasoning across long financial filings, deal documents, and PDF reports
5%Non-HallucinationAA-OmniscienceAvoiding fabricated figures or citations
Strategy & Ops Index30%Business KnowledgeAA-OmniscienceWorking knowledge of business processes, accounting basics, and operational concepts
35%Agentic Knowledge WorkGDPval-AA v2, AA-BriefcaseTool use, planning, and orchestrating multi-step office workflows end-to-end
30%Agentic Tool UseAutomationBench-AACompleting operations, HR, marketing, sales, and support workflows across business apps without breaking guardrails
5%Long-ContextLCR, GDP.pdfHolding context across long threads, policies, records, and PDF documents
Legal Index35%Legal KnowledgeAA-OmniscienceRecall of statutes, doctrines, and procedure across jurisdictions
25%Agentic Knowledge WorkGDPval-AA v2, AA-BriefcaseRunning matter-management workflows, drafting pipelines, and tool-augmented research
15%ReasoningHLEMulti-step argumentation, statutory interpretation, and weighing conflicting authorities
10%Long-ContextLCR, GDP.pdfReading and synthesizing across contracts, discovery productions, case-law packets, and PDF filings
10%Non-HallucinationAA-OmniscienceAvoiding fabricated case cites or invented statutes
5%Agentic Tool UseAutomationBench-AACompleting client support and operations workflows across business apps without breaking guardrails
Healthcare & Medical Index30%Medical & Health KnowledgeAA-OmniscienceClinical knowledge across diagnosis, pharmacology, and care pathways
25%Agentic Knowledge WorkGDPval-AA v2, AA-BriefcaseTool use, planning, and orchestrating EHR/pharmacy workflows end-to-end
15%Long-Context ReasoningMLCR-AASynthesising findings across long, fragmented patient records and claims files
10%Non-HallucinationAA-OmniscienceAvoiding fabricated drug interactions, doses, or guidelines
10%ReasoningHLEMulti-step clinical reasoning across biology and medicine
10%Agentic Tool UseAutomationBench-AACompleting patient support and operations workflows across business apps without breaking guardrails
Engineering Index35%Engineering KnowledgeAA-OmniscienceDomain recall across civil, electrical, mechanical, and other engineering disciplines
30%ReasoningHLE, CritPtMulti-step quantitative reasoning for derivations, sizing calculations, and design trade-offs
20%Agentic Knowledge WorkGDPval-AA v2, AA-BriefcaseTool use, planning, and multi-step execution of engineering deliverables
15%Agentic Terminal UseTerminal-Bench v4.0Operating real terminal environments for builds, scripts, system administration, and debugging
Economics Index35%Economics KnowledgeAA-OmniscienceRecall across micro and macroeconomics, public finance, and markets
35%ReasoningHLEMulti-step quantitative and analytic reasoning for modeling, estimation, and inference
25%Agentic Knowledge WorkGDPval-AA v2, AA-BriefcaseTool use, planning, and multi-step execution of analytical deliverables
5%Long-Context ReasoningLCRReading and reasoning across long reports, datasets, and research notes