Metodologia dos índices de capacidade da Artificial Analysis

Visão geral

Os índices de capacidade da Artificial Analysis medem o desempenho dos modelos em casos de uso específicos, sejam capacidades amplas, como programação, ou áreas profissionais, como direito.

Cada benchmark que compõe um índice é executado de forma independente pela Artificial Analysis antes que suas pontuações sejam combinadas no índice. Como todas as métricas de avaliação, os índices de capacidade têm limitações e podem não se aplicar diretamente a todos os casos de uso, mas oferecem uma síntese útil para comparar modelos no trabalho relevante para determinado domínio.

Os benchmarks subjacentes, incluindo como cada um é executado e pontuado, estão documentados na metodologia de benchmark de inteligência.

Detalhamento dos índices

Os índices são baseados em habilidades ou setores. Os índices de habilidades medem uma capacidade aplicável a diferentes domínios, como programação ou trabalho agêntico, e são calculados como a média de seus benchmarks componentes com pesos iguais. Os índices de setores são voltados a uma única profissão ou área, como Direito, Saúde e Medicina ou Finanças e Contabilidade, e ponderam um conjunto de capacidades conforme a frequência com que cada uma aparece em tarefas reais dessa área.

Nossas ponderações de tarefas se baseiam em uma taxonomia de atividades profissionais no estilo da O*NET. Como todas as métricas de avaliação, esses índices têm limitações e podem não corresponder diretamente a todos os casos de uso. A tabela abaixo mostra os componentes e os pesos de cada índice.

ÍndiceTipoPesoCapacidadeAvaliaçõesDescrição
Agentic IndexSkill50%Agentic Knowledge WorkGDPval-AA v2Tool use, planning, and multi-step execution of real-world knowledge work
50%Agentic Customer Interaction𝜏³-BankingMulti-turn, tool-using customer-support workflows over a knowledge base
Finance & Accounting IndexIndustry30%Business KnowledgeAA-OmniscienceDomain recall in accounting, corporate finance, economics, and investments
30%Agentic Knowledge WorkGDPval-AA v2Tool use, planning, and multi-step task execution, such as running spreadsheets, querying ERPs, or coordinating a workflow
20%ReasoningHLEMulti-step quantitative and analytic reasoning, used for sensitivity analysis, valuation, and structured problem solving
10%Agentic Customer Interaction𝜏³-BankingMulti-turn, tool-using customer workflows over an unstructured knowledge base
5%Long-ContextLCRReading and reasoning across long financial filings, deal documents, and research notes
5%Non-HallucinationAA-OmniscienceAvoiding fabricated figures or citations
Strategy & Ops IndexIndustry30%Business KnowledgeAA-OmniscienceWorking knowledge of business processes, accounting basics, and operational concepts
35%Agentic Knowledge WorkGDPval-AA v2Tool use, planning, and orchestrating multi-step office workflows end-to-end
30%Agentic Customer Interaction𝜏³-BankingMulti-turn dialogue and tool use to resolve customer and stakeholder requests
5%Long-ContextLCRHolding context across long threads, policies, and records
Legal IndexIndustry35%Legal KnowledgeAA-OmniscienceRecall of statutes, doctrines, and procedure across jurisdictions
25%Agentic Knowledge WorkGDPval-AA v2Running matter-management workflows, drafting pipelines, and tool-augmented research
10%Long-ContextLCRReading and synthesizing across contracts, discovery productions, and case-law packets
10%Non-HallucinationAA-OmniscienceAvoiding fabricated case cites or invented statutes
5%Agentic Customer Interaction𝜏³-BankingMulti-turn, tool-using client intake and support workflows
15%ReasoningHLEMulti-step argumentation, statutory interpretation, and weighing conflicting authorities
Healthcare & Medical IndexIndustry35%Medical & Health KnowledgeAA-OmniscienceClinical knowledge across diagnosis, pharmacology, and care pathways
25%Agentic Knowledge WorkGDPval-AA v2Tool use, planning, and orchestrating EHR/pharmacy workflows end-to-end
15%Non-HallucinationAA-OmniscienceAvoiding fabricated drug interactions, doses, or guidelines
15%ReasoningHLEMulti-step clinical reasoning across biology and medicine
10%Agentic Customer Interaction𝜏³-BankingMulti-turn, tool-using patient and member support workflows
Engineering IndexIndustry35%Engineering KnowledgeAA-OmniscienceDomain recall across civil, electrical, mechanical, and other engineering disciplines
35%ReasoningHLE, GPQA Diamond, Crit-PtMulti-step quantitative reasoning for derivations, sizing calculations, and design trade-offs
25%Agentic Knowledge WorkGDPval-AA v2Tool use, planning, and multi-step execution of engineering deliverables
5%Agentic Terminal UseTerminal-Bench v2.1Operating real terminal environments for builds, scripts, system administration, and debugging
Economics IndexIndustry35%Economics KnowledgeAA-OmniscienceRecall across micro and macroeconomics, public finance, and markets
35%ReasoningHLEMulti-step quantitative and analytic reasoning for modeling, estimation, and inference
15%Agentic Knowledge WorkGDPval-AA v2Tool use, planning, and multi-step execution of analytical deliverables
15%Long-ContextLCRReading and reasoning across long reports, datasets, and research notes