跳到主要内容
返回时间线
arXiv来源发表:

EngiWorld 用 1301 个真实工程任务测出:最强模型 EngiScore 仅 44.3,多软件协作成功率 3.6%

核心概要

研究者构建了 EngiWorld 基准,围绕完整工程设计闭环,在 CAD、CAE、CAM、BIM、EDA 与 3D 可视化 6 个领域、26 个专业软件平台上设置 1301 个专家策展任务,并用统一的领域验证器套件对最终与中间产物做几何有效性、物理可行性与规则合规检查;对 7 个前沿模型的评测显示最强模型 EngiScore 仅 44.3,多软件尝试成功率仅 3.6%。

AI-generated editorial illustration: EngiWorld: What Can Frontier Agents Deliver in Professional Engineering Environments?

深度剖析

EngiWorld 把评测对象从“最终界面状态或参考解比对”改为“提交的工程产物本身”,用统一的领域验证器套件检查几何尺寸与拓扑、仿真量、原理图连通性、建筑模型实体关系与 3D 场景结构,并对多软件任务额外检查中间产物与跨阶段一致性。 此前 OSWorld、Spider2-V、ScienceBoard 以最终状态或参考解判定成功,FEABench、BIM-Edit、CADTestBench 等虽验证产物质量但各自局限于单一软件平台与单一任务格式;EngiWorld 把这些单域先例扩展为覆盖 6 个领域的统一验证器套件。 论文报告验证器经参考产物、替代有效解与受控缺陷提交测试;审计组 96 个参考产物全部通过,Abaqus/ANSYS 替代求解器各 40 例、FreeCAD 轻量化设计 5 例均被接受,而 21 例空交付与 21 例仅有指标无产物均被拒绝。

基准覆盖完整设计闭环:1301 个任务分为 6 类互斥任务类型,包括单软件(931)、多软件(60)、软件选择(140)、定量设计(40)、基于图像的建模(120)与开放式任务(10),并提供 GUI 与 CLI 两种交互界面(691 个 CLI、610 个 GUI)。 既有工作多受限于单轮生成或较短步数预算,例如 Text2CAD 以单轮生成为主、CADWorld 步数上限仅一百步;EngiWorld 要求智能体在真实专业软件中多轮交互,并在长操作序列中维持参数化逻辑。 任务经专家标定、AI 辅助的流水线构建,每个最终任务都在指定软件环境中执行并复核;软件覆盖以任务—软件关联计为 1723 个关联。

对 7 个前沿模型的评测显示明显能力缺口:最强模型 EngiScore 仅 44.3,300 个任务中有 128 个被全部 7 个模型得零分,多软件尝试中仅 6 次成功(共 168 次尝试,即 3.6%)。 结果把“通用计算机使用能力”与“专业工程执行能力”区分开来:单软件任务约完成一半、基于图像建模约完成三分之二,但一旦需要跨应用传递中间产物并保持依赖关系,性能急剧下降。 7 个模型在 300 个任务的分层子集上零样本评测(152 个 CLI、148 个 GUI),覆盖 73 个软件与任务类别分层;失败分析中 DONE 但零分与决策轮次耗尽合计占主评测失败的 94.1%。

消融分析显示观测设计与交互历史的影响因模型而异:把参考图直接放入任务消息提升三个模型的 GUI 表现(GPT 从 15.0 升至 31.7),原生分辨率对三个模型都给出最高分,而最优历史长度依模型而定(Gemini 受益于 5 到 15 轮,GPT 在 10 轮后基本持平,Kimi 在 10 轮最佳)。 这些结果说明“更多结构化观测”并不自动转化为更好的工程决策:加入无障碍树使三个模型决策轮次减少,但 API 成本上升 50.7%–147.9%,且对 Gemini 反而降低得分。 消融在 GPT-5.6 Sol、Gemini 3.7 Flash 与 Kimi K3 上进行,并给出任务级增益与回退的配对分析,例如 GPT 的 GUI 增益由 15 个失败转成功与 5 个成功转失败共同构成。

启示与展望

该基准面向在真实专业工程软件中端到端操作智能体的评测,适用于 CAD、CAE、CAM、BIM、EDA 与 3D 可视化 6 个领域、26 个软件平台与工作台,并同时支持 GUI 与 CLI 两种交互方式。它可用于比较不同模型与智能体框架在单软件构建、工具选择、定量设计、跨工具链交付与开放式任务上的表现,也可用于诊断失败发生在设计闭环的哪个阶段。验证器套件与产物检查方法可被后续工作在新增软件或新增工程领域时扩展复用。

主评测在 300 个任务的分层子集上进行,而非全部 1301 个任务,因此全量基准上的模型排序与绝对分数仍有待观察。定量设计与开放式任务的结果部分放在附录中,正文只给出汇总。消融显示观测设计与历史长度的影响因模型而异,甚至同一模型在不同任务上方向相反,说明这些设置与具体任务构成的交互仍需进一步厘清。验证器审计覆盖参考产物、替代解与受控缺陷提交,但容差边界测试不在已完成审计范围内。此外,失败分析中 DONE 但零分与决策轮次耗尽占主导,提示“声明完成”与“通过产物验证”之间的差距是后续工作需要持续关注的方向。

来源