Engineering Index
Assesses model performance across the engineering domain. Capabilities evaluated include domain-specific knowledge (civil, electrical, and mechanical engineering), design and analysis, tooling and automation, technical documentation, and more.
查看代表性工作流The Artificial Analysis Engineering Index combines performance across benchmarks chosen for engineering work, spanning engineering knowledge, reasoning, agentic execution, and terminal use. We map common tasks from O*NET occupational classifications, then select benchmarks that represent this real-world work. Weights are derived from how often capabilities appear across those tasks.
This composite metric provides a single score for tracking model performance across engineering tasks. 所有底层基准测试均由 Artificial Analysis 独立运行。有关评测的实施方式,请参阅我们的智能基准测试方法论。
| 能力 | 权重 | 评测 |
|---|---|---|
| Engineering Knowledge | 35% | AA-Omniscience Science, Engineering & Mathematics Accuracy |
| Reasoning | 30% | HLE和CritPt |
| Agentic Knowledge Work | 20% | GDPval-AA v2和AA-Briefcase |
| Agentic Terminal Use | 15% | Terminal-Bench 4.0 |
得分
Artificial Analysis Engineering Index
Artificial Analysis Engineering Index:能力明细
能力明细
Artificial Analysis Engineering Index:Engineering Knowledge
代表性工作流
这些真实工作流重点检验 Engineering Index 中权重最高的能力。
示例:Design and analyze a wind turbine support structure to size components against fatigue and extreme-wind load cases, justify safety margins against a governing standard such as IEC 61400, and maximize power output while reliably withstanding environmental stress.
示例:Track an intermittent CFD pipeline failure through the CMake build and Conda environment on a Slurm cluster from the terminal, then ship a fix that spares adjacent batch jobs.
示例:Read a vendor package of CAD schematics and dimensioned drawings to extract GD&T callouts, materials, and interface dimensions per ASME Y14.5, reconcile conflicts across sheets, and draft a specification that cites each source drawing.
成本
Artificial Analysis Engineering Index:单任务成本
Artificial Analysis Engineering Index 与单任务成本
速度
Artificial Analysis Engineering Index:单任务耗时
输出 token
Artificial Analysis Engineering Index:单任务输出 token
发布日期
Artificial Analysis Engineering Index 与发布日期
常见问题
根据 Artificial Analysis Engineering Index,目前在工程工作上表现最佳的 AI 模型是 Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) (57)、Claude Fable 5.1 (Adaptive Reasoning, Max Effort, Default Fallback) (57)和GPT-6 Astra (max) (55)。新模型发布后,排行榜会随之更新。
有。Artificial Analysis Engineering Index 是一项独立基准测试,用于衡量 AI 模型在工程工作上的表现。它评估工程知识、定量推理、智能体执行和终端使用等能力。
Engineering Index 是 Artificial Analysis 推出的综合基准测试,用于评估模型在工程领域的表现。评估能力包括土木、电气和机械工程等专业知识,以及设计与分析、工具与自动化、技术文档等。
Engineering Index 按各项能力子分数的加权平均值计算。各项子分数及其权重为:Engineering Knowledge (35%)、Reasoning (30%)、Agentic Knowledge Work (20%)和Agentic Terminal Use (15%)。
Engineering Index 包含 AA-Omniscience Science, Engineering & Mathematics Accuracy、HLE、CritPt、GDPval-AA v2、AA-Briefcase和Terminal-Bench 4.0。
在已公布结果的模型中,Claude Fable 5.1 (Adaptive Reasoning, Xhigh Effort, Default Fallback) 目前以 57 分位居 Engineering Index 榜首。 查看模型
Engineering Index 得分越高,表示模型在构成该指数的各项基准测试中整体表现越强。对于特定用例,单项基准测试结果可能比综合得分更具参考价值。