Todos os índices de capacidade
Índice de Economia
Avalia o desempenho dos modelos em economia. As capacidades avaliadas incluem conhecimento específico do domínio (microeconomia, macroeconomia e finanças públicas), análise e previsão, síntese de pesquisas, modelagem quantitativa e muito mais.
Ver fluxos de trabalho representativosThe Artificial Analysis Economics Index combines performance across benchmarks chosen for economics work, spanning economics knowledge, agentic execution, reasoning, and long-context reading. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across economics tasks. Todos os benchmarks subjacentes são executados de forma independente pela Artificial Analysis. Consulte nossa metodologia de benchmarking de inteligência para saber como as avaliações são realizadas.
| Capacidade | Peso | Avaliações |
|---|---|---|
| Conhecimento econômico | 35% | AA-Omniscience: Precisão em Negócios |
| Raciocínio | 35% | HLE |
| Trabalho de conhecimento agêntico | 25% | GDPval-AA v2.1 e AA-Briefcase v1.1 |
| Raciocínio de contexto longo | 5% | LCR |
Pontuação
Artificial Analysis Índice de Economia
Artificial Analysis Índice de Economia: detalhamento das capacidades
Detalhamento das capacidades
Artificial Analysis Índice de Economia: Conhecimento econômico
Fluxos de trabalho representativos
Fluxos de trabalho reais que exercitam as capacidades às quais o Índice de Economia atribui mais peso.
Exemplo: Estimate the impact of a proposed tariff change by applying incidence and elasticity theory to trade data, then quantify the resulting welfare trade-offs.
Exemplo: Reconcile two studies reaching opposite conclusions on the same minimum-wage question to read both in full, compare their identification strategies, and recommend the more defensible interpretation.
Exemplo: Build a forecasting workbook in Python that ingests several FRED data series to run a baseline ARIMA model, chart the projections, and produce a short written interpretation of the outputs.
Custo
Artificial Analysis Índice de Economia: custo por tarefa
Artificial Analysis Índice de Economia vs. custo por tarefa
Velocidade
Artificial Analysis Índice de Economia: tempo por tarefa
Tokens de saída
Artificial Analysis Índice de Economia: tokens de saída por tarefa
Data de lançamento
Artificial Analysis Índice de Economia vs. data de lançamento
Perguntas frequentes
Segundo o Índice de Economia da Artificial Analysis, os modelos de IA com melhor desempenho em trabalhos de economia atualmente são Claude Opus 5.5 (Max, Default Fallback) (66), Claude Opus 5.5 (Xhigh, Default Fallback) (63) e Claude Fable 5.1 (Max, Default Fallback) (63). O ranking é atualizado à medida que novos modelos são lançados.
Sim. O Índice de Economia da Artificial Analysis é um benchmark independente do desempenho de modelos de IA em trabalhos de economia. Ele mede conhecimento econômico, raciocínio quantitativo, execução agêntica e análise de contextos longos.
O Índice de Economia é um benchmark composto da Artificial Analysis que avalia o desempenho dos modelos em economia. As capacidades avaliadas incluem conhecimento específico (microeconomia, macroeconomia e finanças públicas), análise e previsão, síntese de pesquisas, modelagem quantitativa e muito mais.
O Índice de Economia é calculado como a média ponderada das pontuações de suas capacidades. Estas são as pontuações e seus pesos: Conhecimento econômico (35%), Raciocínio (35%), Trabalho de conhecimento agêntico (25%) e Raciocínio de contexto longo (5%).
O Índice de Economia inclui AA-Omniscience: Precisão em Negócios, HLE, GDPval-AA v2.1, AA-Briefcase v1.1 e LCR.
Atualmente, Claude Opus 5.5 (Max, Default Fallback) tem a maior pontuação no Índice de Economia: 66 entre os modelos com resultados publicados. Ver modelo
Uma pontuação mais alta no Índice de Economia indica melhor desempenho geral nos benchmarks que compõem o índice. Para um caso de uso específico, os resultados de cada benchmark podem ser mais informativos que a pontuação composta.