Todos los índices de capacidades

Engineering Index

Assesses model performance across the engineering domain. Capabilities evaluated include domain-specific knowledge (civil, electrical, and mechanical engineering), design and analysis, tooling and automation, technical documentation, and more.

Ver flujos de trabajo representativos

The Artificial Analysis Engineering Index combines performance across benchmarks chosen for engineering work, spanning engineering knowledge, reasoning, agentic execution, and terminal use. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.

This composite metric provides a single score for tracking model performance across engineering tasks. Artificial Analysis ejecuta de forma independiente todas las evaluaciones subyacentes. Consulta nuestra metodología de Benchmarking de Inteligencia para saber cómo se realizan las evaluaciones.

CapacidadPesoEvaluaciones
Engineering Knowledge35 %AA-Omniscience Science, Engineering & Mathematics Accuracy
Reasoning35 %HLE, GPQA Diamond y Crit-Pt
Agentic Knowledge Work25 %GDPval-AA v2
Agentic Terminal Use5 %Terminal-Bench v2.1

Puntuación

Artificial Analysis Engineering Index

Incorporates 6 evaluations: AA-Omniscience, Humanity's Last Exam, GPQA Diamond, CritPt, GDPval-AA v2, Terminal-Bench v2.1 · Higher is better

Artificial Analysis Engineering Index: desglose de capacidades

Incorporates 6 evaluations: AA-Omniscience, Humanity's Last Exam, GPQA Diamond, CritPt, GDPval-AA v2, Terminal-Bench v2.1 · Desglosado por contribución

Desglose de capacidades

Artificial Analysis Engineering Index: Engineering Knowledge

Incorporates 1 evaluation: AA-Omniscience · Higher is better

Flujos de trabajo representativos

Flujos de trabajo reales que ponen a prueba las capacidades a las que Engineering Index da mayor peso.

Design & analysisEngineering KnowledgeReasoning

Ejemplo: Design and analyze a wind turbine support structure to size components against fatigue and extreme-wind load cases, justify safety margins against a governing standard such as IEC 61400, and maximize power output while reliably withstanding environmental stress.

Tooling & automationReasoningAgentic Knowledge WorkAgentic Terminal Use

Ejemplo: Track an intermittent CFD pipeline failure through the CMake build and Conda environment on a Slurm cluster from the terminal, then ship a fix that spares adjacent batch jobs.

Documentation & specificationEngineering KnowledgeAgentic Knowledge Work

Ejemplo: Read a vendor package of CAD schematics and dimensioned drawings to extract GD&T callouts, materials, and interface dimensions per ASME Y14.5, reconcile conflicts across sheets, and draft a specification that cites each source drawing.

Fecha de lanzamiento

Artificial Analysis Engineering Index vs. fecha de lanzamiento

Most attractive region

Costo

Artificial Analysis Engineering Index: costo por tarea

Costo medio por tarea (USD), desglosado en tokens de entrada, aciertos y escrituras de caché, razonamiento y respuesta

Average cost per task in the index. Costs are split by input, cache hit, cache write, reasoning, and answer token pricing where canonical token counts are available.

Artificial Analysis Engineering Index: costo total

Costo total (USD) de ejecutar el índice

The cost to run the index, calculated using the model's input and output token pricing and the number of tokens used.

Velocidad

Artificial Analysis Engineering Index: tiempo por tarea

Weighted average decode time (minutes) per task; excludes TTFT and overhead time · Lower is better

The weighted average time (minutes) per index task. This is calculated by dividing output tokens per task by output speed, weighted by the relative weights of each benchmark in the index.

Tokens de salida

Artificial Analysis Engineering Index: tokens de salida por tarea

Tokens de salida utilizados para ejecutar una tarea, desglosados en tokens de razonamiento y respuesta

The average number of answer and reasoning tokens produced per benchmark task in this index.

Preguntas frecuentes

Según el Engineering Index de Artificial Analysis, los modelos de IA con mejor desempeño en trabajos de ingeniería son actualmente Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (65), Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (65) y Claude Opus 5 (Adaptive Reasoning, Max Effort) (63). La clasificación se actualiza a medida que se lanzan nuevos modelos.

Sí. El Engineering Index de Artificial Analysis es un benchmark independiente que mide el desempeño de los modelos de IA en trabajos de ingeniería. Evalúa conocimientos de ingeniería, razonamiento cuantitativo, ejecución agéntica y uso de la terminal.

El Engineering Index es un benchmark compuesto de Artificial Analysis que evalúa el desempeño de los modelos en ingeniería. Las capacidades evaluadas incluyen conocimientos específicos (ingeniería civil, eléctrica y mecánica), diseño y análisis, herramientas y automatización, documentación técnica y más.

El Engineering Index se calcula como el promedio ponderado de las puntuaciones de sus capacidades. Estas son las puntuaciones y sus pesos: Engineering Knowledge (35 %), Reasoning (35 %), Agentic Knowledge Work (25 %) y Agentic Terminal Use (5 %).

El Engineering Index incluye AA-Omniscience Science, Engineering & Mathematics Accuracy, HLE, GPQA Diamond, Crit-Pt, GDPval-AA v2 y Terminal-Bench v2.1.

Actualmente, Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) tiene la puntuación más alta en el Engineering Index: 65 entre los modelos con resultados publicados. Ver modelo

Una puntuación más alta en el Engineering Index indica un mejor desempeño general en los benchmarks que componen el índice. Para un caso de uso específico, los resultados de cada benchmark pueden ser más informativos que la puntuación compuesta.