线性贝叶斯神经网络中似然退火使预测均值与方差在不同温度尺度上发生相变,无法同时恢复NNGP后验两阶矩
核心概要
该工作研究单隐层线性贝叶斯神经网络在NTK参数化下的高斯平均场变分推断,推导了温度按宽度幂律衰减时预测分布的极限,发现预测均值与方差在不同温度尺度上发生相变:均值在温度低于显式阈值时偏离先验并最终等于最小二乘预测,方差则在更冷温度下才偏离先验,且不存在能同时恢复未退火NNGP后验均值与方差的温度调度。
Figure 1: Exact mean and variance of f ( x ∗ ) f(x^{*}) under the fitted variational distribution for the eight schedules T M = τ / M c T_{M}=\tau/M^{c} . Dotted lines indicate the prior parameters, the untempered NNGP posterior ( m NNGP ( x ∗ ) = 1.026 m_{\text{NNGP}}(x^{*})=1.026 , v NNGP ( x ∗ ) = 0.25 v_{\text{NNGP}}(x^{*})=0.25 ), the least-squares prediction m ∞ ( x ∗ ) = 2.051 m_{\infty}(x^{*})=2.051 and zero variance.
arXiv深度剖析
在单隐层线性网络、各向同性高斯先验、NTK参数化下,作者推导出温度按幂律衰减时变分预测分布的逐区域极限(定理3.1):预测均值与方差在不同尺度发生相变,均值在温度低于显式阈值时离开先验值,方差则在更冷温度下才离开先验值。 此前关于温度随模型规模缩放的结果(Huix等、Descours等、Harvey等)分别只覆盖平均场缩放或均值被保留的随机特征模型,未覆盖两层同时训练、预测均值也会丢失的NTK缩放。 基于解析推导:均值阈值由AM-GM与三角不等式给出的KL增量和Cauchy-Schwarz给出的似然下降量平衡得到(引理3.1),协方差极限由不动点方程(15)刻画,并在附录B.3给出完整证明。
存在能恢复未退火NNGP后验均值的温度调度,也存在能恢复其方差的调度,但不存在同时恢复两者的幂律调度(推论3.1)。 这给出了似然退火在宽网络中对先验支配的补救能力的精确边界:均值与方差的可恢复温度区间不重叠。 推论3.1由定理3.1的逐区域极限直接推出,均值恢复条件与方差恢复条件分别对应不同的温度指数,二者无法同时满足。
此前被推荐的量级温度调度(如Harvey等按参数量与样本量之比上调似然)落在定理3.1的情形4:其极限均值已是最小二乘预测,而极限方差在温度足够冷时超过NNGP后验方差。 把已有温度处方定位到本文的相变图中,说明它们在均值层面已经越过了NNGP后验均值。 由定理3.1情形4与推论3.1的阈值比较得到,属于解析结论而非经验观察。
有限宽度仿真在合成数据上复现了相变:在最大宽度处各曲线接近其理论极限,温度过冷时后验方差向零塌缩,且温度越冷塌缩越快。 为解析相变提供了有限宽度下的数值佐证,并显示部分方差曲线收敛较慢。 使用固定合成数据集、已知噪声方差、ICM迭代求解一阶条件,并验证拟合为全局极小(附录F.4);作者指出温度接近临界值时方差收敛较慢。
启示与展望
该结果适用于单隐层线性网络、恒等激活、各向同性零均值高斯先验、已知噪声方差的高斯似然,以及样本量与输入维度固定、宽度趋于无穷的NTK缩放。在此设定下,它为温度调度提供了明确的设计依据:若关心预测均值,应选择能恢复NNGP后验均值的温度指数;若关心预测方差,则应选择更冷的温度指数。作者指出,多变量中心极限定理可将单输入的结果推广到预测过程的有限边缘分布;对一般设计矩阵,可通过白化变换满足各向同性二阶矩条件(Remark A.1)。
结论针对变分目标的全局极小点,梯度优化在大宽度下是否达到这些极小点、是否呈现同样的相变,作者明确列为独立问题。向非线性或更深网络、以及允许同一神经元输入与输出权重相关的更大变分族的推广仍待研究。作者还指出,冷后验(似然与先验联合缩放)的变分近似尚未分析,其在不同温度尺度下能否恢复各预测矩是开放问题。此外,仿真中温度接近临界值时方差曲线收敛较慢,因此有限宽度下对临界附近的经验判断需要谨慎。
