Engineering Index
Assesses model performance across the engineering domain. Capabilities evaluated include domain-specific knowledge (civil, electrical, and mechanical engineering), design and analysis, tooling and automation, technical documentation, and more.
Ver flujos de trabajo representativosThe Artificial Analysis Engineering Index combines performance across benchmarks chosen for engineering work, spanning engineering knowledge, reasoning, agentic execution, and terminal use. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across engineering tasks. Artificial Analysis ejecuta de forma independiente todas las evaluaciones subyacentes. Consulta nuestra metodología de Benchmarking de Inteligencia para saber cómo se realizan las evaluaciones.
| Capacidad | Peso | Evaluaciones |
|---|---|---|
| Engineering Knowledge | 35 % | AA-Omniscience Science, Engineering & Mathematics Accuracy |
| Reasoning | 35 % | HLE, GPQA Diamond y Crit-Pt |
| Agentic Knowledge Work | 25 % | GDPval-AA v2 |
| Agentic Terminal Use | 5 % | Terminal-Bench v2.1 |
Puntuación
Artificial Analysis Engineering Index
Artificial Analysis Engineering Index: desglose de capacidades
Desglose de capacidades
Artificial Analysis Engineering Index: Engineering Knowledge
Flujos de trabajo representativos
Flujos de trabajo reales que ponen a prueba las capacidades a las que Engineering Index da mayor peso.
Ejemplo: Design and analyze a wind turbine support structure to size components against fatigue and extreme-wind load cases, justify safety margins against a governing standard such as IEC 61400, and maximize power output while reliably withstanding environmental stress.
Ejemplo: Track an intermittent CFD pipeline failure through the CMake build and Conda environment on a Slurm cluster from the terminal, then ship a fix that spares adjacent batch jobs.
Ejemplo: Read a vendor package of CAD schematics and dimensioned drawings to extract GD&T callouts, materials, and interface dimensions per ASME Y14.5, reconcile conflicts across sheets, and draft a specification that cites each source drawing.
Fecha de lanzamiento
Artificial Analysis Engineering Index vs. fecha de lanzamiento
Costo
Artificial Analysis Engineering Index: costo por tarea
Artificial Analysis Engineering Index: costo total
Velocidad
Artificial Analysis Engineering Index: tiempo por tarea
Tokens de salida
Artificial Analysis Engineering Index: tokens de salida por tarea
Preguntas frecuentes
Según el Engineering Index de Artificial Analysis, los modelos de IA con mejor desempeño en trabajos de ingeniería son actualmente Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (65), Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (65) y Claude Opus 5 (Adaptive Reasoning, Max Effort) (63). La clasificación se actualiza a medida que se lanzan nuevos modelos.
Sí. El Engineering Index de Artificial Analysis es un benchmark independiente que mide el desempeño de los modelos de IA en trabajos de ingeniería. Evalúa conocimientos de ingeniería, razonamiento cuantitativo, ejecución agéntica y uso de la terminal.
El Engineering Index es un benchmark compuesto de Artificial Analysis que evalúa el desempeño de los modelos en ingeniería. Las capacidades evaluadas incluyen conocimientos específicos (ingeniería civil, eléctrica y mecánica), diseño y análisis, herramientas y automatización, documentación técnica y más.
El Engineering Index se calcula como el promedio ponderado de las puntuaciones de sus capacidades. Estas son las puntuaciones y sus pesos: Engineering Knowledge (35 %), Reasoning (35 %), Agentic Knowledge Work (25 %) y Agentic Terminal Use (5 %).
El Engineering Index incluye AA-Omniscience Science, Engineering & Mathematics Accuracy, HLE, GPQA Diamond, Crit-Pt, GDPval-AA v2 y Terminal-Bench v2.1.
Actualmente, Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) tiene la puntuación más alta en el Engineering Index: 65 entre los modelos con resultados publicados. Ver modelo
Una puntuación más alta en el Engineering Index indica un mejor desempeño general en los benchmarks que componen el índice. Para un caso de uso específico, los resultados de cada benchmark pueden ser más informativos que la puntuación compuesta.