跳到主要内容
返回时间线
arXiv来源发表:

OMatGRPO 直接强化晶体生成器的离散组分通道,将 mSUN 从 13.4% 提升到 45.5%,并揭示单元素重排可虚增基准

核心概要

该工作用组相对策略优化(GRPO)直接强化晶体生成器 OMatG 的离散原子类型通道,其闭式似然比使元素选择成为策略动作,配合含稳定性、新颖性与多样性并带稀疏凸包和单元素防护的奖励,在 LeMat-GenBench 上把亚稳、独特且新颖结构(mSUN)的产率从预训练模型的 13.4% 提升到 45.5%,同时记录策略对早期奖励的利用,并指出单元素重排会被现有 mSUN 实现计为发现。

Source-provided article image: Reinforcement Learning on the Discrete Composition Channel of a Crystal Generator: Validated Gains and Reward Hacking
Figure 1 ·

Figure 1: Reinforcement learning on a crystal generator can satisfy the benchmark without real discoveries, but guards in the reward close the exploit. (a) The OMatG generator turns noise with masked element identities into crystals and is scored by mSUN under LeMat-GenBench (Section 4.1 ). Without the single-element guard, RL inflates the pretrained model’s 13.4% to 37.6%, but over half of that mSUN set is single-element repackings of known elements, such as face-centered-cubic Mg counted as a novel material. With the full reward (right, Section 3.3 ), which routes sparse-hull structures to abstention and single-element structures to the penalty reward, mSUN reaches 45.5% with 0.4% single-element structures and DFT-confirmed compounds on well-referenced hulls. (b) The composition channel. Under masked discrete flow matching, each atom’s element identity is a discrete commit event with an exact log-probability, while positions and lattice evolve as a continuous SDE (Section 3.2 ).

arXiv

深度剖析

首次将 GRPO 应用于晶体生成器的离散流匹配组分通道,原子类型在单次分类抽样中提交,似然比具有闭式形式,策略梯度精确作用于组分通道。 此前的扩散与流生成器强化学习要么冻结原子类型、要么将其松弛为连续变量、要么从潜空间事后解码,组分只被间接控制;该工作让元素成为策略的原生离散动作。 附录 A 给出组分通道比率与 KL 项的推导,说明模型仅通过解掩码率进入,调度因子在当前与旧策略下相同并在比率中抵消。

所提奖励在社区基准 LeMat-GenBench 上把 mSUN 从预训练模型的 13.4%(336/2500)提升到 45.5%(1138/2500),并提升已发表的 Chemeleon2 模型。 最佳 N 选择仅达 7.7%,冻结组分通道的强化学习仅达 9.8%,说明大部分增益来自离散组分通道的强化学习;同一奖励在 Chemeleon2 管线内把其 36.6% 提升到 43.7%。 基准以三种机器学习势(Orb、MACE、UMA)集成评分并要求至少两者一致,新颖性与唯一性对照约 530 万条 LeMat-Bulk 结构;密度泛函理论在 67 条可信层亚稳声明中确认 63 条,UMA 与 DFT 凸包距离平均绝对偏差 0.016 eV/atom。

奖励的每一项与防护都是在策略利用前一版本之后加入的,最终的单元素防护把单元素结构在 mSUN 集中的占比压到 0.4%。 无单元素防护的发现运行中,53.5% 的 mSUN 集为单元素结构,且这些重排晶胞在 LeMat-GenBench、MatterGen 评估代码与 Chemeleon2 定义中都被计为亚稳、独特且新颖。 附录 C 以逐运行计数记录五种奖励设计对应的五种利用模式,包括无界稳定性项导致的 Li–O 组成漂移、稀疏凸包上的 O/F 二元化合物漂移,以及单元素重排;防护在三个随机种子下保持。

稳定性标签只与其参考凸包一样可靠,因此所有结果按每个结构背后的参考相数量分层报告。 预训练先验的 mSUN 集中 21.7% 位于参考相少于 12 的凸包上,发现运行中该比例升至 63.4%,而 OMatGRPO 保持在 23.5%;稀疏层 DFT 与 UMA 能量同样吻合,但因 DFT 凸包缺失相同竞争相而无法裁定稳定性。 第二个机器学习势在去除组成线性偏移后以 0.015 eV/atom 的中位绝对差复现稳定性能量;稀疏层 21 条抽查中 19 条能量一致。

启示与展望

该结果面向以热力学稳定性、新颖性与多样性为目标的晶体生成研究,适用于以机器学习势和参考凸包评分的逆向设计流程。奖励互换表明同一奖励在不同解码器管线中的表现不同,因此结论应按宿主管线分别解读。作者建议把稀疏层 mSUN 读作候选而非发现,并指出有前景的稀疏候选可通过计算其缺失竞争相的 DFT 来裁定。代码与运行配置、训练模型与生成结构集均已公开,便于在相同基准约定下复现与扩展。

奖励与基准共享新颖性和唯一性两个组分,作者指出约 80% 的增益来自不优化这两项的奖励,因此增益需在这一循环性下解读。奖励互换的四个单元为单种子,且 Chemeleon2 采样器未设种子、不可逐位复现,作者提出用种子重复来界定其敏感性。第二个机器学习势的 0.015 eV/atom 中位差是在开发运行上计算、未对 OMatGRPO 重复。两条含钆结构的 DFT 计算因电子不收敛或离子步发散被排除,未进入统计。稀疏层 DFT 与 UMA 能量一致但无法裁定稳定性,因为 DFT 凸包缺失相同竞争相。

来源