预训练模型配轻量推理框架在智能体任务中覆盖更多解,后训练带来可量化的锐化税
相关研究与后续进展核心概要
该工作发现,配备轻量推理框架的预训练大模型虽单次准确率(pass@1)远低于后训练版本,但在充足测试时预算下常以更高解覆盖率(pass@K)胜出;作者据此提出锐化税指标量化后训练导致的测试时可扩展性损失,并在四个家族14对模型、三个智能体基准共42个案例中显示该税普遍存在、可由少量采样估计,且提出按提示难度自适应温度的PTGS采样器以降低该税。
Figure 37: The difficulty estimate of PTGS tracks the realized success at the end of training. Each point is one of the last 50 training steps of one of five PPO w/ PTGS runs per environment. The x x -axis is the mean posterior estimate p ¯ x \bar{p}_{x} over the 8 prompts of the step, recorded before the rollouts are drawn, and the y y -axis is the realized success rate of its 128 rollouts.
arXiv深度剖析
预训练大模型在配备轻量推理框架后可作为有能力的智能体,且在充足测试时预算下,其解覆盖率(pass@K)常超过后训练对应模型,尽管单次准确率(pass@1)远低。 此前关于强化学习后训练仅锐化基座行为的假设主要在数学与编程任务中被观察到,本文将其检验扩展到多轮工具使用与交互的智能体任务,并给出与直觉相反的结果。 基于14对基座/后训练模型、四个模型家族、三个智能体基准共42个案例的对比,摘要报告该现象在多数设置中出现。
后训练将任务推向两个极端——总是被解决或从未被解决,从而提升采样效率与一致性,代价是解覆盖率下降。 作者给出机制层面的解释,把后训练的效果刻画为任务难度分布的两极化,而非单纯的性能提升或下降。 摘要称对底层机制进行了分析,并据此提出度量指标;具体分析细节未在摘要中展开。
提出锐化税(Sharpening Tax)这一诊断指标,量化后训练后测试时可扩展性的损失。 该指标把后训练带来的解覆盖率代价转化为可测量量,并可由少量采样估计,且与其他指标相关性良好。 在42个案例中该税在多数设置普遍存在,可由少量rollout估计,并与其他指标良好相关。
提出后验温度化组采样(PTGS),一种即插即用的贝叶斯采样器,按每个提示的估计难度自适应调整采样温度;在两个智能体环境的强化学习训练中,PTGS比固定温度基线缴纳更小的锐化税,在重复采样下解决更多任务,同时提升单次准确率。 把难度自适应的温度调节引入RL训练采样过程,作为降低锐化税的简单可插拔方案。 在两个智能体环境的RL训练中与固定温度基线对比,报告了更小的税、更高的重复采样解出率与更高的单次准确率。
启示与展望
该结果面向使用强化学习后训练大模型并部署为智能体的研究者与工程团队,适用于多轮工具使用与交互的智能体任务,且需要在充足测试时预算下评估解覆盖率。锐化税作为诊断指标可由少量rollout估计,适合在训练与部署前快速评估后训练的测试时可扩展性代价;PTGS作为即插即用采样器,适用于在RL训练中替代固定温度采样。
摘要未给出各基准的具体任务、模型规模、pass@1与pass@K的具体数值、锐化税的估计所需rollout数量,以及PTGS在两个智能体环境中的训练细节与超参数;机制分析中任务两极化如何度量也未展开。读者若需据此调整训练或推理预算,仍需查阅正文中的实验设置与消融结果。
