Todos los índices de capacidades

Economics Index

Assesses model performance across the economics domain. Capabilities evaluated include domain-specific knowledge (microeconomics, macroeconomics, public finance), analysis and forecasting, research synthesis, quantitative modeling, and more.

Ver flujos de trabajo representativos

The Artificial Analysis Economics Index combines performance across benchmarks chosen for economics work, spanning economics knowledge, agentic execution, reasoning, and long-context reading. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.

This composite metric provides a single score for tracking model performance across economics tasks. Artificial Analysis ejecuta de forma independiente todas las evaluaciones subyacentes. Consulta nuestra metodología de Benchmarking de Inteligencia para saber cómo se realizan las evaluaciones.

CapacidadPesoEvaluaciones
Economics Knowledge35 %AA-Omniscience Business Accuracy
Reasoning35 %HLE
Agentic Knowledge Work15 %GDPval-AA v2
Long-Context15 %LCR

Puntuación

Artificial Analysis Economics Index

Incorporates 4 evaluations: AA-Omniscience, Humanity's Last Exam, GDPval-AA v2, AA-LCR v1.1 · Higher is better

Artificial Analysis Economics Index: desglose de capacidades

Incorporates 4 evaluations: AA-Omniscience, Humanity's Last Exam, GDPval-AA v2, AA-LCR v1.1 · Desglosado por contribución

Desglose de capacidades

Artificial Analysis Economics Index: Economics Knowledge

Incorporates 1 evaluation: AA-Omniscience · Higher is better

Flujos de trabajo representativos

Flujos de trabajo reales que ponen a prueba las capacidades a las que Economics Index da mayor peso.

Analysis & forecastingEconomics KnowledgeReasoning

Ejemplo: Estimate the impact of a proposed tariff change by applying incidence and elasticity theory to trade data, then quantify the resulting welfare trade-offs.

Research & synthesisEconomics KnowledgeReasoningLong-Context

Ejemplo: Reconcile two studies reaching opposite conclusions on the same minimum-wage question to read both in full, compare their identification strategies, and recommend the more defensible interpretation.

Modelling & toolingReasoningAgentic Knowledge Work

Ejemplo: Build a forecasting workbook in Python that ingests several FRED data series to run a baseline ARIMA model, chart the projections, and produce a short written interpretation of the outputs.

Fecha de lanzamiento

Artificial Analysis Economics Index vs. fecha de lanzamiento

Most attractive region

Costo

Artificial Analysis Economics Index: costo por tarea

Costo medio por tarea (USD), desglosado en tokens de entrada, aciertos y escrituras de caché, razonamiento y respuesta

Average cost per task in the index. Costs are split by input, cache hit, cache write, reasoning, and answer token pricing where canonical token counts are available.

Artificial Analysis Economics Index: costo total

Costo total (USD) de ejecutar el índice

The cost to run the index, calculated using the model's input and output token pricing and the number of tokens used.

Velocidad

Artificial Analysis Economics Index: tiempo por tarea

Weighted average decode time (minutes) per task; excludes TTFT and overhead time · Lower is better

The weighted average time (minutes) per index task. This is calculated by dividing output tokens per task by output speed, weighted by the relative weights of each benchmark in the index.

Tokens de salida

Artificial Analysis Economics Index: tokens de salida por tarea

Tokens de salida utilizados para ejecutar una tarea, desglosados en tokens de razonamiento y respuesta

The average number of answer and reasoning tokens produced per benchmark task in this index.

Preguntas frecuentes

Según el Economics Index de Artificial Analysis, los modelos de IA con mejor desempeño en trabajos de economía son actualmente Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (66), Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (65) y Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) (64). La clasificación se actualiza a medida que se lanzan nuevos modelos.

Sí. El Economics Index de Artificial Analysis es un benchmark independiente que mide el desempeño de los modelos de IA en trabajos de economía. Evalúa conocimientos económicos, razonamiento cuantitativo, ejecución agéntica y análisis de contextos extensos.

El Economics Index es un benchmark compuesto de Artificial Analysis que evalúa el desempeño de los modelos en economía. Las capacidades evaluadas incluyen conocimientos específicos (microeconomía, macroeconomía y finanzas públicas), análisis y pronósticos, síntesis de investigaciones, modelado cuantitativo y más.

El Economics Index se calcula como el promedio ponderado de las puntuaciones de sus capacidades. Estas son las puntuaciones y sus pesos: Economics Knowledge (35 %), Reasoning (35 %), Agentic Knowledge Work (15 %) y Long-Context (15 %).

El Economics Index incluye AA-Omniscience Business Accuracy, HLE, GDPval-AA v2 y LCR.

Actualmente, Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) tiene la puntuación más alta en el Economics Index: 66 entre los modelos con resultados publicados. Ver modelo

Una puntuación más alta en el Economics Index indica un mejor desempeño general en los benchmarks que componen el índice. Para un caso de uso específico, los resultados de cada benchmark pueden ser más informativos que la puntuación compuesta.