SAGO 用逐样本稳定性重估十一个 LLM:没有模型一致泛化,跨数据集变化足以反转排名
核心概要
该工作提出 Stability-Aware Generalization Objective(SAGO)框架,把大语言模型的泛化定义为同一输入在语义等价变体下行为的逐样本稳定性,并在生成一致性、内部激活、置信度与响应镜像四个行为轴上,对十一个开源与闭源模型、六个数据集进行评测,发现所有模型至少在某一轴上超出显著性阈值,各轴捕捉相互独立的失败模式,且跨数据集的变化足以反转模型排名。
深度剖析
SAGO 把泛化从聚合准确率改写为逐样本行为稳定性:对每个提示构造语义等价变体集合,比较基线与变体在多个行为轴上的变化,并用归一化后的逐提示 RMS 不稳定性聚合成 Stability Generalization Score(SGS)。 既有工作多以单一领域、单一改写家族或聚合基准分数评估鲁棒性,本文把多数据集、多变异家族与多行为轴放进同一个逐样本分析中,并明确以变异性而非可被窄化训练优化的分数为目标。 论文给出形式化目标(式 1–2)、归一化与 RMS 聚合定义、以及以非零容忍阈值为原假设的单侧 t 检验,主结果取 5% 阈值,并在 1%、5%、10% 三档阈值下报告稳健性。
四个行为轴被实例化为激活几何、生成一致性、置信度与不确定性、响应镜像,覆盖从内部表示到表面输出的路径。 隐藏状态几何、BLEU/BERTScore、序列对数概率与 token 熵、风格顺应此前各自在单独文献中使用,本文首次把它们组合进同一逐样本分析,并把镜像作为不预设意图的行为敏感性来测量。 各轴给出具体度量与尺度因子,例如激活轴用最后一层隐藏状态的余弦相似度、生成一致性同时用 BLEU 与 BERTScore-F1(RoBERTa-large 骨干)、置信度同时保留长度敏感与长度不变的两种视角;镜像检测器按变异家族分别设计,社会语域镜像用 GPT-4o-mini 作评判并对 10% 标签人工核验。
评测显示泛化不稳定普遍存在且高度异质:没有模型一致泛化,行为轴捕捉独立失败模式,跨数据集变化可反转模型排名。 这直接挑战了把单一鲁棒性分数或单一行为指标当作泛化代理的做法,并给出具体反例:Gemma 家族中 G4-E4B 的生成不稳定性高于其前代,而 Q3.5-9B 在开源池中生成一致性最好却在置信度与镜像上最不稳定。 十一个模型(八个开源、三个闭源)跨六个数据集;-BLEU 与 -MR 在所有模型上达到显著性;-Ent 在所有模型上均处于可接受阈值内(最大约 0.012),显示 token 级分布锐度与输出级稳定性基本解耦;L-8B 的 -Cos 与 -MR 在六个数据集间跨度大到足以反转排名。
规模与闭源与否都不消除不稳定,而是把不稳定转移到不同行为维度。 论文报告 L-8B、G-7B、Q-7B 在多数轴上与更小同族模型同样或更不稳定,从而排除失败模式随参数量消失的假设;闭源模型因 API 限制只能观测部分轴,其不稳定画像与开源模型不同。 规模比较基于同族不同尺寸模型的 SGS 对比;闭源侧仅 GPT-5.4 可计算 -Ent,激活与序列对数概率轴因 API 限制不可得,因此闭源结论被限定在可观测轴上。
启示与展望
该框架适用于需要判断模型在同一目标与上下文的不同表达下行为是否稳定的场景,例如部署前的鲁棒性画像、模型选型与训练干预验收;它给出的是在哪里、变化多大的行为证据,而非因果机制。对使用者而言,最直接的用法是把 SGS 当作按轴、按数据集、按变异家族分别阅读的画像,而不是一个可比的单一分数;论文也建议比较应以画像为基础而非排名为基础,因为一个模型可能在内容稳定性上更优,另一个在置信度稳定性或减少表面镜像上更优。
论文自述的边界值得读者留意:SAGO 测量行为在哪里变化、变化多大,但不解释因果机制,表示漂移、解码敏感性与镜像仍纠缠在一起;数据集仅限英文,跨语言、跨文字系统与跨文化提示惯例是否保持同样的轴解离尚未检验;-BLEU 捕捉词汇偏离,可能反映无害的改写,因此需要 -BERT 作为语义层面的补充;5% 的操作点针对典型逐提示不稳定性验证,罕见或最坏情况失败可能需要更大样本;结构变异与社会语域镜像依赖 GPT-4o-mini,可能引入风格偏差,且闭源模型的 API 限制使结论仅限可观测轴。此外,本次读取的文本中部分公式、图与附录表格以占位或截断形式呈现,样本量消融的具体数值与部分图注无法完整核对,因此关于推荐样本量与位置、强度消融的细节应以原文为准。
