跳到主要内容
返回时间线
arXiv来源发表:

冻结基座加对数几率校正:CRN v2 修正 53.3% 错误且 MMLU/BoolQ 无退化,LoRA 修正 83.3% 却掉 17–75 个百分点

核心概要

该研究提出 CRN v2——一个 34M 可训练参数(占 4.65B 文本模块的 0.73%)、架在完全冻结的 Gemma 4 E2B 之上的对数几率级校正模块,经 83,400 对纠错数据的监督微调与无参考 DPO 训练后,在 60 题 CEHRI 领域考试上修正 53.3% 的基座错误(改写版 43.3%),并在 MMLU、BoolQ、car-wash 上无退化;而参数预算匹配的 LoRA 基线修正 83.3%,却在同一批基准上损失 30–75% 能力。

AI-generated editorial illustration: Safe Error Correction for Language Models: Frozen-Base Adjustment with Capability Preservation

深度剖析

提出并验证“冻结基座 + 对数几率校正 + KL 锚定”这一设计原则:校正模块只读取基座最终隐藏状态并产生加性对数几率修正,基座不接收任何梯度。 与 LoRA、适配器、前缀微调等把可训练容量注入基座计算图内部的做法不同,CRN v2 是侧网络,不触碰任何基座参数;与 ROME、MEMIT 等直接改写权重的模型编辑相比,它避免权重手术并保持基座完整。 论文自述这是设计原则研究而非架构新颖性主张,公式为“标准低秩瓶颈”;训练数据为 83,400 对、17,810 个唯一提示,SFT 2,000 步加 DPO 500 步,在 Apple M4 上端到端约 25 分钟。

给出“校正—能力权衡”的可测证据:CRN v2 在原始考试修正 53.3%(32/60,基座单独答对 7/60)、改写版 43.3%(52/120),MMLU 125/200、BoolQ 144/200、car-wash 6/8 与冻结基座完全一致。 同一批基准上,参数预算匹配 CRN v1 的 LoRA 基线(6.6M 参数、rank 19)修正 83.3%(50/60)与 77.5%(93/120),但 MMLU 降至 64/200、BoolQ 降至 110/200、car-wash 降至 0/8,退化 17–75 个百分点。 论文给出 95% Wilson 区间:53.3% 为 [40.9%, 65.4%],83.3% 为 [72.0%, 90.7%];作者同时说明每任务样本量小(MMLU/BoolQ 各 200,car-wash 仅 8),且“无退化”仅指这三个被测基准。

KL 保持项是承重结构:把 KL 权重从 0.1 降到 0.01,原始考试修正率从 53.3% 掉到 35.0%,改写版从 43.3% 掉到 25.8%,而能力保持不受影响。 该消融把“锚定项是否必要”从直觉变成可测变量,并给出“校正模块必须贴近基座表示才有效”的定性模式。 作者明确提示该消融混淆了三个变量——rank(128 对 256)、KL(0.1 对 0.01)、DPO 步数(500 对 2000),因此不能把下降单独归因于 KL,需要单变量扫描。

注入深度扫描(探索性)未发现任何配置超过 rank-128 对数几率结果:层 7 隐藏态注入(1.6M 参数、SFT-only)达 50.0%/55.8%,层 4 降到 30.0%/28.3%,多层对数几率校正(35M)仅 40%,更长训练(5,000 SFT + 2,000 DPO)仍为 53.3%;层 7 上做 DPO 会摧毁能力(MMLU 13%、BoolQ 退化)。 这组结果把“更深注入是否更好”变成经验问题,并给出与“冻结计算图构成上限”一致的模式,而非理论天花板证明。 作者声明这些是单次运行、会话内观察结果,只有层 7 SFT-only 一行经日志独立核验;深度 4 与 DPO 行日志已移除、检查点未保留,能力探针很小。

启示与展望

该结果面向在固定领域内、以冻结语言模型为基座、且把“不损害通用能力”置于“最大化纠错率”之上的部署场景;它给出的是可复现的工程路径——34M 参数、0.73% 基座规模、单次前向即可产出修正后对数几率,代码、主结果权重与评测脚本均已发布,深度变体仅发布代码。对研究者而言,它把“校正—能力权衡”变成可对照的实验设置:同一数据、同一 DPO 目标下比较侧网络与 LoRA。对实践者而言,它提示在能力退化不可接受的场合,宁可接受较低纠错率。

读者仍需留意:原始考试的全部 60 个提示逐字出现在训练数据中,改写版是模板式近重复(平均 71.6% 字符重叠),因此两者都不检验分布外泛化;KL 消融混淆了 rank、KL 权重与 DPO 步数,单变量扫描尚未完成;能力基准每任务样本量小(MMLU/BoolQ 各 200,car-wash 仅 8),更细差异需要更大样本;HellaSwag 因评分解析器与生成格式不匹配而两个模型均为 0/200,论文据此不作结论;自回归推理每生成一个 token 需一次完整基座前向(无 KV 缓存),在 M4 上约 1 秒/token;训练数据规模有限,扩展行为未知;深度注入变体除层 7 SFT-only 外缺乏独立核验。53% 究竟是硬上限还是当前最佳,论文本身也留作开放问题。

来源