跳到主要内容
返回时间线
arXiv来源发表:

SoftServe 用变分目标构造正定曲率估计,在病态深度学习任务上取得低于 Adam、Muon、SOAP 的损失

相关研究与后续进展

核心概要

作者提出 SoftServe 一族拟牛顿方法,从 Berglund 等(2025)的变分目标中导出正定曲率估计,即使存在负曲率也保持正定,并给出对角与 Kronecker 分解两种变体,用稳定的耦合 Newton-Schulz 迭代以 GPU 友好的矩阵乘法替代昂贵的矩阵分解;在循环网络、深度自编码器、物理信息神经网络以及一个 1.36 亿参数的物理信息扩散模型等严重病态问题上,其损失常低于 Adam、Muon 和 SOAP 等基线。

Source-provided article image: SoftServe: A Scalable Quasi-Newton Method for Deep Learning
Figure 1 ·

Figure 1: Training objectives against gradient evaluations: prediction MSE for RNN Adding (left), and reconstruction binary cross-entropy with ℓ 2 \ell_{2} regularization for full-batch MNIST (middle) and minibatch MNIST (right). Lines show three-seed means; shading spans the seed minimum and maximum. K-BFGS(L) with failed seeds are shown as individual traces.

arXiv

深度剖析

SoftServe 从 Berglund 等(2025)的变分目标中导出正定曲率估计,在存在负曲率时仍能保持正定,且不需要线搜索或针对曲率的临时修正。 以往拟牛顿方法在深度学习中受限于非凸性与巨大参数量,常依赖线搜索或临时曲率修正;该工作把正定曲率估计建立在变分目标之上,从而绕开这两类障碍。 摘要以方法构造性陈述为主,说明正定性来自变分目标而非事后修正;未给出具体定理编号或数值验证细节。

作者给出对角与 Kronecker 分解两种变体,按构造保持正定,并可扩展到大规模神经网络。 把正定拟牛顿更新做成可扩展的参数化形式,使方法能用于参数量巨大的网络,而不只是小规模凸问题。 摘要陈述两种变体“按构造”保持正定并“可扩展到大规模神经网络”,属于设计层面的说明,未列出参数量与内存开销的对照数据。

SoftServe 使用稳定的耦合 Newton-Schulz 迭代完成所需矩阵运算,用 GPU 友好的矩阵乘法替代昂贵的矩阵分解。 把拟牛顿方法中的矩阵分解瓶颈换成适合 GPU 的乘法运算,从而降低在硬件上落地的代价。 摘要明确给出所用迭代名称与替代关系,属于方法层面的陈述;未提供迭代收敛速度或与分解方法的实测对比。

在严重病态问题上,包括循环网络、深度自编码器、物理信息神经网络以及一个 1.36 亿参数的物理信息扩散模型,SoftServe 常取得低于 Adam、Muon 和 SOAP 的损失。 把拟牛顿方法的效果展示从凸优化扩展到深度学习的病态任务,并与当前常用的一阶与结构化基线直接比较。 摘要给出任务类型、一个 1.36 亿参数模型规模以及基线名称,并用“often achieving lower losses”描述结果,未给出逐任务的数值表格或统计显著性。

启示与展望

该工作面向深度学习中严重病态的无约束优化场景,适用于循环网络、深度自编码器、物理信息神经网络以及大规模物理信息扩散模型等训练任务;对角与 Kronecker 分解变体按构造保持正定,配合耦合 Newton-Schulz 迭代以矩阵乘法替代矩阵分解,因而适合在 GPU 上扩展到参数量巨大的网络。对希望在不引入线搜索与临时曲率修正的前提下使用拟牛顿方法的实践者,这一族方法提供了可直接对照 Adam、Muon、SOAP 的候选方案。

摘要未给出各任务的具体损失数值、训练步数或收敛曲线,也未说明 1.36 亿参数模型之外各任务的规模,因此“常取得更低损失”的幅度与稳定性仍需在正文中确认。正定曲率估计来自 Berglund 等(2025)的变分目标,其在该族方法中的具体推导与适用条件属于需要进一步阅读的部分。对角与 Kronecker 分解变体在内存与每步计算开销上的实际表现,以及耦合 Newton-Schulz 迭代的收敛行为,摘要均未展开。此外,本次仅依据摘要进行总结,未读取正文、图表与附录,上述判断以摘要所述范围为限。

来源