预训练在权重中留下谱指纹:按架构与策略分格后,单一谱统计量可在无目标数据时排序116个基础模型的OOD鲁棒性
核心概要
该工作提出按(架构×预训练策略)划分的15个“格”来读取预训练权重的谱结构,证明OOD精度差距受源表征集中度约束,并用每格选定的单一谱统计量在116个模型、7种模态上排序OOD鲁棒性,且对EEG、基因组与蛋白等矩阵外家族在评估前锁定方向后得到前瞻性验证。
Figure 1: (Architecture × \times Strategy) → \to Spectral Geometry → \to OOD Robustness. Architecture and pretraining strategy jointly shape the layer-wise singular-value spectrum (2) , which determines whether representations are concentrated or diffuse (3) , setting the OOD accuracy gap (4) . The sign of ρ \rho is a property of the cell and of the statistic read in it, not of the domain: each AR-CLM cell is positive under its own calibrated metric, while BiDi-MLM/Protein, CNN and SSM-v2/RWKV are negative under theirs.
arXiv深度剖析
论文给出一个理论链条:定理1把OOD精度差距与源特征的log stable rank集中度联系起来,引理2把嵌套残差权重与最终特征几何连接,命题3–5为AR-CLM、BiDi-MLM与ViT-CLIP给出架构条件化的权重空间代理统计量。 此前把权重谱统计量与模型质量联系的工作主要针对分布内泛化,且对所有架构套用同一统计量;这里把关系形式化到(架构×策略)格内,并扩展到OOD鲁棒性。 证明在T1–T6等显式假设下给出,作者明确把T4的集中度桥接、HT训练关系、序保持与极性分配列为仍需经验检验的假设,而非普遍数学事实。
在15个主格中,每格选定的谱统计量都能排序模型OOD下降幅度,平均留一Spearman相关为0.824;454个格内成对比较中,该统计量在92%的情况下识别出更鲁棒的模型。 全局池化时单一统计量只有0.245,仅按策略为0.478,仅按架构为0.745;逐级条件化呈单调增益,说明(架构×策略)是仍能保持格内度量–OOD关系一致的最粗分组。 覆盖116个模型、7种模态;9/15格双侧显著,4格在预设方向下单侧显著,2格为边缘证据;留一格分析显示去掉任一格后14格均值在0.800–0.824之间。
作用于谱集中度的干预可缩小OOD差距:在22个NLP模型、1232次干预中,把源特征矩阵截断到前k个左奇异向量,使OOD下降相对未截断基线减少24%,同时保留87.5%的分布内精度,且下降幅度随k单调变化。 该结果把定理1中的近端变量作为可直接操作的量,并给出效应量层级:直接作用于特征集中度的干预优于经由更长权重–特征链条传播的干预。 两个保持特征秩不变的零对照(LoRA秩适配与秩手术)均无OOD收益;按度量标记层做权重修复在9/10个NLP模型中优于随机定位。
诊断可无数据迁移到矩阵外家族:对EEG、AMPLIFY蛋白与Evo2基因组,格、度量与符号在观察OOD结果前锁定,3/3方向预测得到确认;AMPLIFY的秩百分位判定未被确认,仅成对排序成立。 这构成前瞻性检验而非事后举例,把权重空间诊断从分布内泛化推进到发布时的OOD鲁棒性筛查。 EEG在BiDi-Transformer与BiMamba/线性注意力两个子组均呈正方向;Evo2-7B在5个物种上OOD NLL低于随机而1B接近随机;BioNeMo ESM-2结果待定。
启示与展望
该框架的适用范围是在格内排序模型,而不是预测目标域上的绝对精度;它面向需要在发布或选型阶段筛查OOD脆弱性的研究者与工程团队,且只需已发布权重、架构与预训练策略标签。对谱缩放行为不同的架构子类型(如RoPE相对绝对位置编码)需要各自的校准集,格内拐点检测可发现这种不连续;在公开模型稀少的领域锚定方向需要一次基于参考模型的校准。干预部分在22个NLP模型与1232次干预中把OOD下降减少24%并保留87.5%分布内精度,为按失败模式选择修复方法提供了起点。
读者仍需留意:T4的联合归一化边际集中、HT训练关系、从权重到特征的序保持以及部分格的极性分配,作者自己列为经验可检验的假设而非已证事实;15格的p值未对在同一批结果上选择每格度量与符号做校正;ViT-DINO与SSM-Mamba两格为边缘证据,且其公开检查点数量已穷尽;AMPLIFY案例中秩百分位判定未被确认,提示校准集需匹配目标模型的架构子类型;两个同时测量分布内与OOD的干预案例中特征秩上升而OOD下降,作者说明这两例未显示中介。此外,本次解析的文本中多处数值、表格单元格与公式符号缺失,若需引用具体相关系数、置信区间或效应量,应回到原文核对。
