NeutronGym 用 McStas 物理评分训练 LLM 智能体设计中子仪器,Qwen3-8B 从 11% 提升到 77%
相关研究与后续进展核心概要
该工作提出 NeutronGym——一个可执行的中子仪器设计环境,智能体通过验证工具搭建仪器、由 McStas 进行射线追踪、并以语法/运行时/结构/科学四级阶梯评分且不依赖 LLM 评判;在 McStasBench 的 16 个已发表仪器任务上七个模型最多复现 7 个、无一检索到参考、无一达到改进目标,而用其奖励做强化学习可把 Qwen3-8B 在隐藏设计家族的留出实例上从 11% 提升到 77%(第二个种子 69%),超过未训练的 Qwen3-32B。
Figure 2: Pass rates on held-out instances ( n = 300 n=300 ; 150 150 for the no-model probe) with Wilson 95% intervals, covering instance sampling for a fixed policy, not training-seed variation (8 points) or grading-seed fragility (§ 5.3 ). (a) The trained 8B passes the untrained 32B on all four gated families and no fixed-answer or lookup baseline comes close; ∗∗∗ : p < 10 − 3 p<10^{-3} , paired exact McNemar against the untrained 32B (discordant 208 vs. 12, 89 vs. 43, 116 vs. 12, 125 vs. 29). Guide match is replicated at a second seed; the other three are single runs. (b) Guide match under a tightening tolerance: the trained policy’s designs sit inside the tolerance, the untrained one’s on its edge.
arXiv深度剖析
提出 NeutronGym,据作者所知是首个面向中子仪器设计的可执行环境:智能体通过验证工具构建仪器,McStas 对构建结果做射线追踪,再由一个分级阶梯对语法、运行时、结构和科学四个层面评分,全程不使用 LLM 评判。 把仪器设计从文本问答转为可执行、可自动评分的物理任务,评分依据是射线追踪结果而非模型自评或人工判断。 环境由验证工具、McStas 射线追踪与四级评分阶梯构成,作者强调评分“no LLM judge”;程序化家族提供固定布局的无限实例并设留出参数区间。
构建了 McStasBench:从已发表仪器中整理出 16 个任务,并配有记忆探测与沙箱;七个模型最多复现 16 个中的 7 个,没有一个能检索到参考,也没有一个达到改进目标。 用记忆探测与沙箱把“复现”与“记忆/检索”区分开,给出当前模型在该任务上的可量化基线。 16 个任务来自已发表仪器,评测覆盖七个模型,报告的是复现数量上限、检索与改进目标三类结果。
该环境可用于训练:以其奖励做强化学习,把 Qwen3-8B 在某个目标来自隐藏设计的家族留出实例上从 11% 提升到 77%(第二个种子为 69%),超过未训练的 Qwen3-32B,并在另外三个受门控家族上各以一个种子复现该配方。 表明该环境的奖励信号本身可驱动能力提升,而不只是评测工具。 报告了 11%→77% 与第二种子 69% 的具体数值,以及三个额外家族各一个种子的复现结果。
分析刻画了增益来源:去掉阶梯的部分给分后成绩下降 60 分;仅凭奖励,训练模型在智能体的模拟预算下、且被提供闭式物理时,才达到经典优化器的水平(77% 对 81%,该差距在此规模下不显著),而前沿模型仍能解决 98–99%。 把“训练有效”拆解为部分给分与闭式物理信息两个条件,并给出与经典优化器和前沿模型的对照。 给出 60 分下降、77% 对 81% 的对比及“在此规模下不显著”的表述,以及前沿模型 98–99% 的对照;作者还提到为得到可信结果而放弃了四个无模型基线即可解决的任务设计,并公开了发现它们的探测。
启示与展望
该环境面向中子仪器设计这一具体场景,智能体在固定布局的程序化家族中设定设计参数,并在留出参数区间上评测;McStasBench 的 16 个任务来自已发表仪器,配有记忆探测与沙箱。训练结果针对 Qwen3-8B 及若干受门控家族,报告了第二个种子与三个额外家族各一个种子的复现。作者指出,仅凭奖励达到经典优化器水平需要提供闭式物理,且该差距在此规模下不显著;前沿模型仍能解决 98–99%。这些设定界定了结果适用的范围:可仿真、可自动评分、参数化的仪器设计任务。
读者可能仍会关注:程序化家族与 McStasBench 之外的仪器设计能否沿用同一评分阶梯;训练结果在更多种子与更多家族上的稳定性;以及“仅凭奖励达到经典优化器水平需提供闭式物理”这一条件在更复杂布局下的表现。作者提到为得到可信结果而放弃了四个无模型基线即可解决的任务设计,并公开了发现它们的探测,这些探测对判断任务难度分布具有参考意义。当前文本为摘要层面的信息,未包含图表与完整实验细节,因此上述数值的具体实验设置仍需查阅原文。
