跳到主要内容
返回时间线
Machine Learning Science and Technology来源发表:

用随机投影的 Hessian-向量积替代完整 Hessian 监督,训练误差接近全二阶方法而每轮提速逾 24 倍

核心概要

作者提出投影 Hessian 学习(PHL),用基于 Hutchinson 迹估计的 Hessian-向量积(HVP)随机投影替代显式 Hessian 构造来监督机器学习原子间势(MLIP)的二阶曲率,在 ωB97XD/6-31G(d) 生成的反应物、产物、过渡态、IRC 与简正模采样数据集上比较 E-F、E-F-HVP(one-column 与 Hutchinson)和 E-F-H 四种方案,发现按小批量随机重采样探针向量时两种 HVP 方法在能量、力、Hessian 精度上与完整 Hessian 训练统计上不可区分,同时每轮训练提速超过 24 倍;在每分子仅一个固定 HVP 的更现实情形下,Hutchinson 投影在远离平衡的几何上持续

AI-generated editorial illustration: Projected Hessian learning: Fast curvature supervision for accurate machine-learning interatomic potentials

深度剖析

PHL 把二阶监督写成只依赖 Hessian-向量积的随机损失:将 Hessian 误差的 l2 损失视为矩阵迹,用 Hutchinson 估计 tr A ≈ v^T A v 得到无偏近似 L_H ≈ |H̃v − Hv|²/(3N)²,从而无需显式构造或存储 (3N)×(3N) 的 Hessian。 此前 Hessian 监督训练要么显式构造完整 Hessian(二次内存与计算开销),要么每次只取 Hessian 的随机一列(one-hot 探测);PHL 用随机探针向量在期望意义上聚合多个曲率方向,把二阶监督成本降到接近力级别。 论文给出 Hutchinson 估计无偏性的推导,并在补充材料中给出两种估计量的均方误差解析式:在 Hessian 误差随原子间距衰减的局域性假设下,Hutchinson 的 MSE 随 O(N) 增长,而 one-hot 的 MSE 随 O(N²) 增长。

在小批量随机重采样探针向量的设定下,one-column 与 PHL 两种 HVP 方法在能量、力、Hessian 精度上统计上不可区分,并接近完整 Hessian 训练;相对 E-F 基线,NMS 数据集上能量 RMSE 降低约 29%、力 RMSE 降低约 48%、Hessian RMSE 降低约 77%。 这表明显式 Hessian 监督的大部分精度收益可以通过随机曲率采样获得,而不必付出完整 Hessian 的代价;配对 t 检验在所有数据集与性质上均未发现两种估计量的显著差异(p > 0.05)。 结果基于 Test、IRC、NMS 三个数据集,每种方法训练五个独立随机种子的模型集成,报告集成均值与标准差,并用配对双样本 t 检验与 Bland–Altman 分析评估差异。

在每分子仅有一个固定 HVP 的数据受限情形下,Hutchinson 型 PHL 在 NMS 几何上相对 one-column 进一步降低能量 RMSE 6.2%、力 RMSE 5.6%、Hessian RMSE 11.2%,且 Hessian 精度在全部三个数据集上均显著更优(p < 0.01)。 固定探针更贴近实际量子化学只能提供有限二阶信息的场景;此时随机 Hutchinson 向量对曲率方向的采样更均匀,而单列探测受限于单一坐标方向,方向偏差在数据稀疏与远离平衡时更明显。 差异由五个独立训练模型的配对 t 检验支持:NMS 能量 p = 0.006,IRC 与 NMS 力 p = 0.013 与 0.006,三个数据集 Hessian 均 p < 0.01;补充材料的 Bland–Altman 分析显示固定探针下置信区间排除零。

计算效率上,完整 Hessian 训练平均每轮约 326.5 秒,而 one-column 与 PHL 分别约 13.6 秒与 13.3 秒,相对 E-F-H 提速约 24 倍,相对标准 E-F 训练(约 4 秒/轮)仅增加约三倍开销;在量子化学层面,单个 HVP 可通过两次类力操作(前向-反向或反向-反向自动微分,或沿固定方向 v 的力有限差分)获得,成本接近两次力计算,远低于完整 Hessian。 这把二阶监督的成本从随体系规模二次增长降到接近力级别,使曲率信息在数据生成与 MLIP 训练两端都变得可行。 训练耗时在 NVIDIA A6000 GPU 上按轮记录并取多轮平均;DFT 成本标度用 Gaussian16 对最多 100 个原子的体系比较能量、力、完整 Hessian 与 HVP 的 CPU 时间。

启示与展望

该工作面向需要二阶响应性质的 MLIP 开发场景,尤其是反应性势能面与数据受限的二阶监督流程。它使曲率信息可以在不显式构造 Hessian 的前提下进入训练损失,适用于量子化学只能提供有限 HVP 的情形,也适用于希望以接近力级别成本获得二阶正则化效果的大规模训练管线。作者指出,当探针向量固定时,参考 HVP 可由沿 v 的力有限差分获得,从而把曲率监督扩展到需要大超胞的体相材料性质(如表面与缺陷)。方法在 ANI 与 HIP-NN 上实现,代码与 OpenREACT-CHON-EFH 数据集公开,便于在同类架构上复现与扩展。

实验体系为小分子,数据集中位原子数约 14,而 Hutchinson 相对 one-column 的优势主要来自大 N 极限下的解析标度预测,因此向数百至数千原子的凝聚相或超胞体系的收益仍需实测确认。随机探针数量、每结构探针数 K 与损失权重 λ_H 等超参数对精度与成本的影响,正文未给出系统扫描。此外,本文的对比集中在能量、力与 Hessian 三类目标,对声子、弹性常数等下游响应性质的端到端影响尚未在本文中直接评估。

来源