Economics Index
Assesses model performance across the economics domain. Capabilities evaluated include domain-specific knowledge (microeconomics, macroeconomics, public finance), analysis and forecasting, research synthesis, quantitative modeling, and more.
Ver fluxos de trabalho representativosThe Artificial Analysis Economics Index combines performance across benchmarks chosen for economics work, spanning economics knowledge, agentic execution, reasoning, and long-context reading. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across economics tasks. Todos os benchmarks subjacentes são executados de forma independente pela Artificial Analysis. Consulte nossa metodologia de benchmarking de inteligência para saber como as avaliações são realizadas.
| Capacidade | Peso | Avaliações |
|---|---|---|
| Economics Knowledge | 35% | AA-Omniscience Business Accuracy |
| Reasoning | 35% | HLE |
| Agentic Knowledge Work | 25% | GDPval-AA v2 e AA-Briefcase |
| Long-Context Reasoning | 5% | LCR |
Pontuação
Artificial Analysis Economics Index
Artificial Analysis Economics Index: detalhamento das capacidades
Detalhamento das capacidades
Artificial Analysis Economics Index: Economics Knowledge
Fluxos de trabalho representativos
Fluxos de trabalho reais que exercitam as capacidades às quais o Economics Index atribui mais peso.
Exemplo: Estimate the impact of a proposed tariff change by applying incidence and elasticity theory to trade data, then quantify the resulting welfare trade-offs.
Exemplo: Reconcile two studies reaching opposite conclusions on the same minimum-wage question to read both in full, compare their identification strategies, and recommend the more defensible interpretation.
Exemplo: Build a forecasting workbook in Python that ingests several FRED data series to run a baseline ARIMA model, chart the projections, and produce a short written interpretation of the outputs.
Data de lançamento
Artificial Analysis Economics Index vs. data de lançamento
Custo
Artificial Analysis Economics Index: custo por tarefa
Artificial Analysis Economics Index: custo total
Velocidade
Artificial Analysis Economics Index: tempo por tarefa
Tokens de saída
Artificial Analysis Economics Index: tokens de saída por tarefa
Perguntas frequentes
Segundo o Economics Index da Artificial Analysis, os modelos de IA com melhor desempenho em trabalhos de economia atualmente são Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (63), Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (62) e Claude Opus 5 (Adaptive Reasoning, Max Effort) (61). O ranking é atualizado à medida que novos modelos são lançados.
Sim. O Economics Index da Artificial Analysis é um benchmark independente do desempenho de modelos de IA em trabalhos de economia. Ele mede conhecimento econômico, raciocínio quantitativo, execução agêntica e análise de contextos longos.
O Economics Index é um benchmark composto da Artificial Analysis que avalia o desempenho dos modelos em economia. As capacidades avaliadas incluem conhecimento específico (microeconomia, macroeconomia e finanças públicas), análise e previsão, síntese de pesquisas, modelagem quantitativa e muito mais.
O Economics Index é calculado como a média ponderada das pontuações de suas capacidades. Estas são as pontuações e seus pesos: Economics Knowledge (35%), Reasoning (35%), Agentic Knowledge Work (25%) e Long-Context Reasoning (5%).
O Economics Index inclui AA-Omniscience Business Accuracy, HLE, GDPval-AA v2, AA-Briefcase e LCR.
Atualmente, Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) tem a maior pontuação no Economics Index: 63 entre os modelos com resultados publicados. Ver modelo
Uma pontuação mais alta no Economics Index indica melhor desempenho geral nos benchmarks que compõem o índice. Para um caso de uso específico, os resultados de cada benchmark podem ser mais informativos que a pontuação composta.