冻结视觉语言模型无需训练即可通过复用解码器层块实现候选多样性,pass@9平均提升6.58个百分点
核心概要
该工作提出“架构采样”:一种免训练方法,通过复用解码器层中选定的层块,让冻结模型沿不同前向计算路径生成候选,在五个Qwen检查点和十二个多模态基准上,以相同的九个候选预算将pass@9相对标准路径温度采样平均提升6.58个百分点,复用早期层收益最强,候选覆盖提升在贪心解码下依然存在,且候选词面重叠更低,用作无标签测试时强化学习的rollout时准确率提升。
Figure 1: Two Sources of Candidate Diversity. Temperature sampling (left) draws several outputs from the same standard computation path, starting from the initial multimodal representation h ( 0 ) h^{(0)} . Architectural sampling (right) changes the computation path from the same h ( 0 ) h^{(0)} before producing one candidate from each path. The background is a conceptual illustration of the answer space.
arXiv深度剖析
提出架构采样,用不同前向计算路径而非同一路径上的温度扰动来产生候选答案。 常规温度采样让每个候选沿同一固定计算路径生成,而该方法通过改变所复用解码器层块的位置与重复次数引入计算多样性。 摘要报告该方法免训练、不更新模型权重、不增加辅助参数,并在五个Qwen检查点与十二个多模态基准上评估。
在相同九个候选预算下,架构采样比标准路径温度采样平均提升pass@9达6.58个百分点。 提升来自候选覆盖的扩大,而非增加采样数量或改动模型参数。 摘要给出跨五个检查点、十二个基准的平均提升数值,并指出复用早期层收益最强。
候选覆盖的改善在贪心解码下依然存在,且生成候选的词面重叠更低。 说明多样性并非仅由随机采样温度带来,而是与计算路径差异相关。 摘要明确报告贪心解码下覆盖提升持续存在,以及候选间词面重叠更低。
这些候选作为无标签测试时强化学习的rollout时能提升准确率。 把架构采样的价值从候选覆盖扩展到从模型自身输出中更有效地学习。 摘要报告在无标签测试时强化学习设定下使用该候选后准确率提升。
启示与展望
该结果面向使用冻结视觉语言模型、以多候选采样进行测试时扩展的场景,尤其是希望在不更新权重、不增加辅助参数的前提下扩大候选覆盖的实践者;方法通过复用解码器层块并调整其位置与重复次数来生成候选,摘要指出复用早期层收益最强,因此该设定下的收益最明确。其价值也延伸到把候选用作无标签测试时强化学习rollout的流程。
可见文本仅为摘要,未提供逐基准结果、层块位置与重复次数的具体配置、计算开销对比以及统计显著性信息;6.58个百分点是跨检查点与基准的平均值,其在不同任务与模型规模上的分布仍需在正文中确认。贪心解码下覆盖提升的机制解释、以及测试时强化学习收益的稳定性,也是读者可继续关注的方向。
