跳到主要内容
返回时间线
arXiv来源发表:

广义拉普拉斯活跃子空间:用少量曲率方向实现神经网络可扩展不确定性量化

核心概要

该工作提出一种基于广义贝叶斯框架的低秩拉普拉斯近似,将神经网络后验限制在由经验平均损失的广义高斯-牛顿曲率主导方向张成的活跃子空间中,用无矩阵Lanczos算法计算特征对并以经验贝叶斯标定先验方差;在回归与分子生成分类任务上,标准贝叶斯缩放会随数据量增大而过度收缩后验方差、迫使保留大量弱曲率方向,而均值损失缩放仅需少数方向即可获得校准且连贯的预测区间。

Source-provided article image: Scalable AI Uncertainty Quantification via Generalized Laplace Active Subspaces
Figure 1 ·

Figure 1: The matrix-vector product G ​ v ∈ ℝ D Gv\in\mathbb{R}^{D} with D = 2701 D=2701 , computed using the matrix-free method outlined in Section 4.1.5 , and by explicitly forming matrix G G via ( 28 ). The absolute error | G ​ v − ( G ​ v ) e ​ x ​ p ​ l ​ i ​ c ​ i ​ t | |Gv-(Gv)_{explicit}| is plotted on the right vertical axis.

arXiv

深度剖析

提出广义拉普拉斯活跃子空间(GLAS)方法:从经验平均损失定义的广义贝叶斯后验出发,在预训练权重处构造局部高斯近似,后验方差在保留子空间内具有闭式表达,先验方差由经验贝叶斯准则标定,活跃子空间维度由留出校准数据的经验覆盖率选取。 与在训练中优化变分分布的贝叶斯神经网络方法(如Bayes by Backprop)不同,该方法是事后近似、无需额外训练;与经典活跃子空间从模型梯度未中心化协方差构造不同,这里子空间来自经验平均损失的广义高斯-牛顿曲率主导特征方向,直接绑定数据拟合的局部几何。 方法在三个算例上验证:已知噪声的标量回归(权重空间维度小到可显式构造完整矩阵,用于验证无矩阵向量积与特征对,绝对误差在torch.float32量级)、UCI混凝土抗压强度回归(约含大量连接权重,评估可扩展性)、以及REINVENT的3层LSTM分子语言模型(每层256神经元、约160万权重,在ChEMBL SMILES上训练)。

核心发现是广义后验的缩放方式并非技术细节:标准贝叶斯缩放(对应求和负对数似然)会使主导活跃方向的后验方差随训练数据量增大而收缩,回归中按数据量、分类中按数据量比例收缩,从而迫使低秩框架为达到名义覆盖率而保留大量弱曲率方向。 已有低秩拉普拉斯子空间工作(如Faller与Martin)在线性化拉普拉斯设定下构造子空间,其所需维度仍在数十到数百;本文指出标准缩放下这一维度膨胀的根源是数据量驱动的后验收缩,并用均值损失缩放避免该收缩,使校准覆盖只需少数曲率方向。 在已知噪声回归中,广义缩放仅需2个活跃方向即达到90%覆盖率且区间连贯,标准缩放需更多方向且区间更宽、连贯性更差;训练数据量增大后广义缩放仍为2维,而标准缩放所需方向增至43个。在混凝土强度算例中,广义缩放在少量活跃维度即达标,标准缩放在允许范围内始终未达标,即使50个曲率方向也不足以覆盖,90%置信区间仅覆盖约60%校准数据。

当后验样本通过非线性网络传播时,标准缩放所需的额外弱曲率方向会引入较大参数扰动,可能使样本移出拉普拉斯近似可靠的局部区域,导致预测均值偏离预训练模型、预测区间变宽且不稳定;线性化拉普拉斯可消除该非线性采样伪影,但标准缩放的过度后验收缩依然存在。 该分析把低秩后验的维度选择与非线性传播下的预测连贯性联系起来,说明在保留完整非线性网络的设定下,参数扰动的大小与一致性至关重要,而广义均值损失缩放通过更小的活跃子空间同时减少非线性采样伪影与所需曲率-向量积数量。 在已知噪声回归中,标准缩放、较大数据量下预测均值与区间质量明显退化;线性化拉普拉斯虽使预测均值回到展开点预测、区间显著变窄,但在最大允许维度50下仅覆盖约75%与40%校准数据。混凝土算例中标准缩放的区间被判定为过度自信,广义缩放的均值大致居中于验证数据、90%区间覆盖多数数据而不过宽。

活跃子空间在高维权重空间中高度局部化:通过由活跃子空间特征模导出的活动分数(个体连接权重的敏感性指标)可见,混凝土算例中最敏感的1000个连接权重(仅占总数0.1%)迅速饱和并贡献了大部分曲率敏感性,其余99.9%权重仅占约5%总敏感性;分子生成算例中前7.6%的活动分数已占95%总敏感性。 活动分数原用于物理模型的一阶敏感性分析,这里被用于检查曲率贡献在神经网络中是广泛分布还是集中于少数连接权重,结果显示活跃子空间不仅维度低,而且在权重空间中也局部化。 结果以累积活动分数的对数-对数图呈现(混凝土算例图8、分子算例图12),分子生成算例的曲线饱和较慢,但仍显示前7.6%活动分数占95%总敏感性。

启示与展望

该方法面向已预训练、以经验平均损失训练的神经网络,适用于回归与分类的事后不确定性量化;在回归中通过留出校准数据的经验覆盖率联合选取活跃子空间维度与先验方差,在分类中则需保证正确类别以近似给定概率被包含。其设计目标是让不确定性集中在少数数据可告知的曲率方向上,从而在保留完整非线性网络的同时获得校准且尖锐的预测区间。作者指出,将该广义贝叶斯活跃子空间拉普拉斯近似扩展到微调语言模型(如Laplace-LoRA设定)是未来方向,可把拉普拉斯近似的作用从探测生成敏感性转向纠正微调自回归模型的过度自信。

读者仍需关注若干开放问题:标准缩放与广义均值损失缩放定义的是不同的后验对象,作者明确说明标准缩放并非本身有缺陷,后验随数据收缩是标准贝叶斯更新的预期特征,因此缩放选择应结合具体低秩UQ目标判断。分子生成算例中,广义缩放在活跃维度增大时有效性下降、序列长度出现长右尾、SlogP超过5的概率显著升高,作者将其解释为扰动可能把自回归动力学推出化学上有意义的区域,但该算例被定位为对自由运行分子生成的敏感性研究,预训练REINVENT在token层面已较为校准,因此不应期待拉普拉斯后验改善其预测分布。此外,分子算例通过子采样SMILES字符串计算特征模,作者观察到某些子采样规模下存在明显离群点,可能源于Lanczos算法未收敛,并建议用副本特征向量内积矩阵标记此类情况;这一子采样近似对最终结论的影响值得读者留意。本文为全文阅读,但部分公式与图表在文本中以编号引用而未展开具体数值,读者若需复现应结合作者公开的PyTorch代码与数据。

来源