冻结7B主干、只训10万偏置参数:无标签TTRL在MATH-500达76.67%,并迁移到4500道未参与优化的问题
核心概要
该工作提出无标签的偏置-only测试时强化学习:冻结预训练主干,仅用多数投票伪标签作为奖励、只优化约10万个偏置参数(28层MLP的down_proj.bias),在MATH-500上Qwen2.5-7B达76.67%、Qwen2.5-Math-7B达79.50%,同一流程还改善视觉语言与音频推理,冻结后的偏置向量在4500道验证互斥MATH题上把Qwen2.5-7B从46.3%提升到70.9%、Qwen2.5-Math-7B从52.5%提升到75.4%,并从伪标签可靠性与可及梯度能量两方面解释受限子空间为何仍能有效适配。
深度剖析
在极端优化瓶颈下仍能发生实质性的测试时适配:主干冻结、仅约10万可训练偏置参数、奖励完全来自模型自身rollout的多数投票伪标签,六个模型-基准组合全部优于未训练基线,MATH-500上Qwen2.5-Math-7B为79.50%、Qwen2.5-7B为76.67%。 此前的TTRL类方法通常更新大部分或全部参数,而该工作把TTRL的多数投票奖励与GRPO保持不变,只把优化空间压缩到偏置子空间,从而把“参数效率”本身当作研究受限测试时学习何以可能的变量。 结果以三个独立训练种子的均值±标准差报告,固定200步预算;同一100K参数流程跨文本、视觉语言、音频使用,仅任务提示与奖励/评分函数不同。
学习到的偏置向量不止作用于测试时优化所用的问题:冻结第200步检查点、不再训练,在4500道验证互斥MATH题上Qwen2.5-7B由46.3%升至70.9%、Qwen2.5-Math-7B由52.5%升至75.4%。 这检验了适配是否只是对MATH-500这500道题的过拟合,结果显示干预可迁移到未参与优化的问题集合。 迁移评测在冻结检查点上进行、无进一步训练,问题集被描述为验证互斥。
在匹配参数预算下,可训练子空间的选择比参数数量更关键:九个单层偏置子空间各含3584个参数,其可及梯度能量与训练后准确率的Spearman相关为ρ=0.83(精确双尾置换检验,p<0.01);参数匹配的LoRA(exact-match,10万参数)在六个基准上均低于偏置-only TTRL,并在LogicVista上低于未训练基线。 论文把“可及梯度能量”(全梯度投影到可训练子空间的平方范数)作为受限子空间可训练性的刻画量,并给出受限子空间改进下界,说明保证的局部改进由该量而非子空间维度决定。 理论侧给出命题与定理的证明草图;实证侧为九层扫描的秩相关检验,以及同预算下不同参数化(偏置、LoRA、ReFT风格变体)的对照。
伪标签奖励的可靠性随rollout数量提升:在正间隔假设下,多数投票伪标签出错的概率随rollout数指数衰减,实验显示伪标签准确率的排序同时跟随rollout数量与共识强度。 这把“自生成信号是否足够可靠”与“子空间是否对齐”并列为受限测试时学习成功的两个条件,而此前工作多只关注奖励构造本身。 理论为基于Hoeffding不等式与联合界的证明草图;实证为MATH-500一批问题上按前缀计算多数投票并记录共识代理与准确率。
启示与展望
该结果面向部署阶段的无标签适配场景:已有预训练检查点、可对同一批无标注问题多次采样rollout、并允许在推理时施加固定的加性偏置向量。适用对象是7B量级、含28层MLP解码器的模型(Qwen2.5-7B、Qwen2.5-Math-7B、Qwen2.5-VL-7B-Instruct、Qwen2.5-Omni-7B),训练预算固定为200步,评测为贪心解码pass@1。方法本身不依赖真值标签,因此可用于标注稀缺的数学、视觉语言与音频推理任务;论文也给出长度感知奖励变体(ShorterBetter)在Qwen2.5-7B上以75.2%对74.2%略高于二值奖励并把平均响应长度缩短30%,以及1.5B规模上Qwen2.5-1.5B(+54pp)与Qwen2.5-Math-1.5B(+37pp)的大幅绝对提升,提示该路线在小模型上同样可启动。
多模态增益的构成仍需按任务细看:AI2D的提升部分来自官方解析器抽取失败率下降,即输出格式合规性改善;LogicVista在448题上穷举审计为77题由错转对、47题由对转错,未发现单一主导混淆;MathVista上被引导模型在全部49道年龄差题上恒答0,该模板对净增益的贡献为62道净改善题中的1题;MMAU上“统计含某重音/非重音音素的词数”这一模板占15.3%(153/1000),其提升为15.1pp,而其余847题仅提升1.4pp,约三分之二的MMAU增益来自该模板,论文明确表示排除该模板后的提升落在种子波动范围内,因此MMAU是六个基准中最弱的一项。此外,附录D中与标注偏置向量的比较并非受控比较:标注向量用RLOO在4万道DeepScaleR题上训练并在MATH-500上分布外评测,得75.6%对无标签的72.0%,与正文表2中“同配方下标签来源不构成瓶颈”的结论方向不同,论文说明两者回答的是不同问题。可及梯度能量的分析基于单层扫描与固定16题批次的共享反向传播,跨层、跨任务、跨模型规模的可及梯度能量是否同样预测可训练性,以及多数投票伪标签在窄模板上收敛到固定答案的倾向如何被训练过程自身识别,仍是开放问题。
