Engineering Index
Assesses model performance across the engineering domain. Capabilities evaluated include domain-specific knowledge (civil, electrical, and mechanical engineering), design and analysis, tooling and automation, technical documentation, and more.
Repräsentative Workflows ansehenThe Artificial Analysis Engineering Index combines performance across benchmarks chosen for engineering work, spanning engineering knowledge, reasoning, agentic execution, and terminal use. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across engineering tasks. Alle zugrunde liegenden Benchmarks werden unabhängig von Artificial Analysis durchgeführt. Wie die Evaluierungen ablaufen, erläutert unsere Methodik für das Intelligenz-Benchmarking.
| Fähigkeit | Gewichtung | Evaluierungen |
|---|---|---|
| Engineering Knowledge | 35 % | AA-Omniscience Science, Engineering & Mathematics Accuracy |
| Reasoning | 30 % | HLE und CritPt |
| Agentic Knowledge Work | 20 % | GDPval-AA v2 und AA-Briefcase |
| Agentic Terminal Use | 15 % | Terminal-Bench v4.0 |
Punktzahl
Artificial Analysis Engineering Index
Artificial Analysis Engineering Index: Aufschlüsselung der Fähigkeiten
Aufschlüsselung der Fähigkeiten
Artificial Analysis Engineering Index: Engineering Knowledge
Repräsentative Workflows
Praxisnahe Workflows, die besonders die von Engineering Index am stärksten gewichteten Fähigkeiten prüfen.
Beispiel: Design and analyze a wind turbine support structure to size components against fatigue and extreme-wind load cases, justify safety margins against a governing standard such as IEC 61400, and maximize power output while reliably withstanding environmental stress.
Beispiel: Track an intermittent CFD pipeline failure through the CMake build and Conda environment on a Slurm cluster from the terminal, then ship a fix that spares adjacent batch jobs.
Beispiel: Read a vendor package of CAD schematics and dimensioned drawings to extract GD&T callouts, materials, and interface dimensions per ASME Y14.5, reconcile conflicts across sheets, and draft a specification that cites each source drawing.
Kosten
Artificial Analysis Engineering Index: Kosten pro Aufgabe
Artificial Analysis Engineering Index vs. Kosten pro Aufgabe
Geschwindigkeit
Artificial Analysis Engineering Index: Zeit pro Aufgabe
Ausgabe-Token
Artificial Analysis Engineering Index: Ausgabe-Token pro Aufgabe
Veröffentlichungsdatum
Artificial Analysis Engineering Index vs. Veröffentlichungsdatum
Häufig gestellte Fragen
Laut dem Artificial Analysis Engineering Index sind Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (57), Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (57) und GPT-6 Astra (max) (55) derzeit die leistungsstärksten KI-Modelle für Ingenieursaufgaben. Die Rangliste wird bei der Veröffentlichung neuer Modelle aktualisiert.
Ja. Der Engineering Index von Artificial Analysis ist ein unabhängiger Benchmark für die Leistung von KI-Modellen bei Ingenieursaufgaben. Er misst Ingenieurwissen, quantitatives Schlussfolgern, agentische Ausführung und Terminalnutzung.
Der Engineering Index ist ein zusammengesetzter Benchmark von Artificial Analysis, der die Modellleistung im Ingenieurwesen bewertet. Geprüft werden unter anderem Fachwissen zu Bauingenieurwesen, Elektrotechnik und Maschinenbau, Konstruktion und Analyse, Werkzeuge und Automatisierung sowie technische Dokumentation.
Der Engineering Index wird als gewichteter Durchschnitt seiner Teilpunktzahlen berechnet. Die Teilpunktzahlen und ihre Gewichtungen sind: Engineering Knowledge (35 %), Reasoning (30 %), Agentic Knowledge Work (20 %) und Agentic Terminal Use (15 %).
Der Engineering Index enthält AA-Omniscience Science, Engineering & Mathematics Accuracy, HLE, CritPt, GDPval-AA v2, AA-Briefcase und Terminal-Bench v4.0.
Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) erzielt derzeit mit 57 die höchste Punktzahl im Engineering Index unter den Modellen mit veröffentlichten Ergebnissen. Modell ansehen
Eine höhere Punktzahl im Engineering Index steht für eine insgesamt stärkere Leistung in den Benchmarks des Index. Für einen bestimmten Anwendungsfall können einzelne Benchmark-Ergebnisse aussagekräftiger sein als die zusammengesetzte Punktzahl.