后训练把任务推向“必解或必不解”两端:14对基座/后训练模型在三个智能体基准上普遍被征收“锐化税”,PTGS采样器把税降下来
核心概要
该工作系统比较了14对开源基座与后训练模型(Gemma-4、Ministral-3、Qwen2.5、Qwen3.5,3B至35B)在BFCL v4多轮、WebShop、ACEBench三个多轮工具调用基准上的pass@1与pass@K,发现配备轻量harness的基座模型单次准确率远低,但在足够测试时预算下解覆盖常超过后训练版本;作者把这一覆盖损失定义为“Sharpening Tax”,并证明后训练把每个任务的成败概率推向“总是解出”或“总是解不出”两端,最后提出按提示难度自适应调温的PTGS采样器,在两个智能体环境中同时提升单次准确率与覆盖并降低该税。
深度剖析
在智能体任务上,配备轻量harness的预训练基座模型能够完成多轮工具调用,并在测试时预算增大时在解覆盖(pass@K)上追平甚至超过其后训练版本。 此前关于“后训练只是锐化基座行为、以覆盖换准确率”的证据几乎全部来自数学与编程任务,而智能体任务的多轮工具使用与环境交互被认为更依赖后训练新获得的能力;该工作把这一比较搬到三个过程式评分的智能体基准上。 14个基座/后训练检查点对、四个模型家族、三个基准共42个模型-基准组合,每个任务128次rollout;例如WebShop上gemma-4-31B基座在预算增大后覆盖超过85%,而其后训练版本为56%。
后训练把每个任务的成败概率双峰化:中间地带(“给足算力就能解出”)的任务大幅减少,任务被推向“总是解出”与“总是解不出”两个极端,从而以覆盖换取采样效率与一致性。 把此前以缩放曲线目视比较为主的观察,转化为对每任务成功概率分布形态的刻画,并给出“总是通过/给算力可通过/总是失败”的三分类统计。 以gemma-4-31B在WebShop为例,中间类别从87.6%降到30.0%,“总是解出”从0.0%升到26.0%,“总是失败”从12.4%升到44.0%;该现象在四个家族中均可复现,Qwen3.5锐化最轻、Gemma-4最陡。
提出Sharpening Tax这一标量诊断指标,量化后训练相对基座模型损失的测试时可扩展性,并显示该税在多数设置下普遍存在、可由少量rollout预估、且与其他评测指标强相关。 把需要逐条目视检查的pass@K缩放曲线,压缩成一个可比较、可预测的单一数值,并给出其概率解释(成功对重试的依赖程度)。 42个组合中36个在预算增大时税上升;用一半任务上的8次rollout估计的税,能较好预测留出任务上的税(Spearman相关很高),并与一致性差距呈正秩相关。
提出posterior-tempered group sampling(PTGS):用Beta-二项后验在线估计每个提示的难度,按难度自适应调整采样温度,难提示升温、已掌握提示降温;在PPO与GRPO、Sokoban与FrozenLake上同时提升pass@1与pass@K并降低税。 不同于全局升温或固定截断,PTGS只改训练rollout的采样分布、不改RL更新本身,属于即插即用的采样侧方案,并配有关于rollout组学习信号的理论分析。 在Qwen2.5-7B-Instruct上微调200步、每设置5次运行取均值:Sokoban上PPO的pass@1/pass@K为46.5/55.0、税0.094,加PTGS后为61.1/69.7、税0.081;FrozenLake上PPO为63.7/74.1、税0.039,加PTGS后为65.0/80.0、税0.020。
启示与展望
该工作面向使用开源基座/后训练检查点对的研究者与工程团队,适用于文本型LLM智能体、多轮工具调用与二值成功判定的评测场景:BFCL v4多轮、WebShop、ACEBench,预算以rollout次数计(每任务128次)。它给出的可直接使用产物包括:一个可由少量rollout估计的税指标,可用于在基座与后训练模型之间按任务路由测试时预算;以及一个不改动RL算法、只改训练rollout温度的PTGS采样器,可插入PPO、GRPO等现代RL流程。作者指出,由于开源模型未披露预训练与后训练数据,分析属于观察性而非干预性,在数据混合完全已知的受控设置中复现,才能给出锐化何时、如何出现的因果解释。
作者列出的开放问题包括:不同后训练类型(RL、监督微调、on-policy蒸馏)各自征收多少税尚未比较;结论限于文本型LLM智能体,多模态LLM与视觉-语言-动作模型是否同样存在准确率-一致性-覆盖的三角权衡仍待检验;Sharpening Tax依赖二值成功信号,扩展到开放式生成需要以质量门控的多样性度量替代pass@K;税与对比解码、模型合并、过程奖励建模等基座/后训练配对的其它用途之间的关系也有待刻画。此外,本文所依据的文本为论文全文,但部分图表以图像形式给出,具体数值细节需回到原文图表核对。
