MOOSEnger 用仿真感知智能体框架把 MOOSE 输入的可执行成功率从 5% 提升到 89.5%
核心概要
MOOSEnger 是一个面向多物理场面向对象仿真环境(MOOSE)生态的建模与仿真 AI 智能体框架,其仿真感知 harness 将可替换的推理模型与领域知识检索、HIT 感知解析、语法元数据、语言服务器诊断、修订受控写作以及本地或 MCP 支持的验证与执行结合为“生成—检查—修复—运行”流程;在覆盖八个仿真族的 200 条提示上,可执行成功率由 10/200(5%)提升至 179/200(89.5%,GPT 5.2 API),并在 Gemma 4 31B 上由 0/200 提升至 153/200(76.5%);在十例制造解法(Method of Manufactured Solutions)基准上,全部十个生成输入满足语义对齐判据,其中
Figure 1 : Core-plus-domain architecture. The reasoning model is replaceable, while the MOOSE plugin and core runtime retain the domain evidence, artifact lifecycle, validation policy, and execution gates. Model substitution therefore changes how a candidate is produced, not the artifact-level conditions used to accept it.
arXiv深度剖析
该工作提出 MOOSEnger,一个面向 MOOSE 生态的建模与仿真 AI 智能体框架,其核心是仿真感知 harness,把可替换的推理模型与有依据的领域知识、修订后的仿真工件、MOOSE 专用验证以及可执行的求解器反馈组合在一起。 相对于一次性大语言模型生成,该框架把“生成”置于一个包含 MOOSE 知识检索、HIT 感知解析、语法元数据、语言服务器诊断、修订受控写作以及本地或 MCP 支持的验证与执行的完整系统之中。 证据来自对框架构成的描述,以及跨八个仿真族的 200 条提示与十例制造解法基准上的评测结果。
在 200 条提示、八个仿真族上,MOOSEnger harness 把可执行成功率从 10/200(5%)提升到 179/200(89.5%,GPT 5.2 API),并在 Gemma 4 31B 上从 0/200 提升到 153/200(76.5%)。 该结果把可执行可靠性归因于完整的智能体系统,而不是单独的推理模型,因为同一 harness 在两种不同推理模型上都带来了大幅提升。 证据为两个模型上各 200 条提示的可执行成功计数,覆盖八个仿真族。
在十例制造解法基准上,全部十个生成输入满足语义对齐判据,其中八个成功执行并满足规定的单网格数值精度判据。 该基准把评测从“能否执行”推进到语义对齐与数值精度,指向物理信息化的验证路径。 证据为十例基准上的语义对齐判据与单网格数值精度判据的通过计数。
该框架的“生成—检查—修复—运行”工作流把证据绑定到每一次输入修订,并在接受前引导有界修复。 相对于一次性生成,这一流程针对的是小语法、模式、引用或求解器配置错误会阻止看似合理的输入执行的问题,同时指出成功执行本身并不等于科学正确。 证据来自对工作流与验证机制的描述,以及上述可执行成功率与制造解法基准结果。
启示与展望
该工作面向 MOOSE 生态的建模与仿真输入生成,适用于需要把可替换推理模型接入仿真感知 harness 的场景,其 harness 包含 MOOSE 知识检索、HIT 感知解析、语法元数据、语言服务器诊断、修订受控写作以及本地或 MCP 支持的验证与执行。评测覆盖八个仿真族的 200 条提示与十例制造解法基准,因此其结论适用于这一范围内的可执行可靠性与语义对齐、单网格数值精度判据。该框架为物理信息化的验证以及未来完整应用级与工程验证和确认实现提供了一条路径。
本次读取为摘要范围,未包含完整论文的图表与细节,因此关于 harness 各组件的具体实现、修复策略的边界、以及制造解法基准中未通过数值精度判据的两个案例的具体原因,仍需在原文中进一步查看。此外,成功执行本身并不等于科学正确,这一区分提示读者在把可执行成功率外推到科学正确性时需要谨慎。
