跳到主要内容
返回时间线
arXiv来源发表:

9B小模型靠并行回火采样在GPQA、AIME与LCB上追平前沿模型,且无需更新参数

核心概要

该工作提出并行功率回火(PPT),把经典并行回火(副本交换)搬到序列级功率锐化采样上,用不同锐化强度的多个副本并行探索与利用、并通过交换把有希望的推理轨迹送到最锐化的输出链,同时用固定视界构造消除早期停止功率采样中的结构性截断偏差;在Qwen3-4B、Qwen3-8B与Qwen3.5-9B上跨MATH500、GPQA、HumanEval、GSM8K、AIME 24&25与LiveCodeBench v5的评测中,PPT在所有模型—基准组合上取得最好或并列最好成绩,超过Power Sampling、PowerSMC与GRPO,且Qwen3.5-9B上达到与前沿模型相当的水平。

AI-generated editorial illustration: Explore Broadly, Reason Sharply: Push Small Models toward the Frontier via Sampling

深度剖析

PPT把并行回火(副本交换)适配到LLM的序列级功率锐化采样:在一条锐化功率阶梯上并行运行多个副本,低功率副本负责广泛探索不同推理轨迹,高功率副本负责利用锐化目标偏好的高似然回答,相邻副本按Metropolis–Hastings规则交换整条记录。 此前的LLM副本交换方法按前缀长度设置中间目标,而PPT让所有副本共享同一视界、在不同锐化功率上交换完整序列记录,从而在同一完成空间上把平坦分布下的探索与锐化目标下的集中显式耦合起来。 交换接受率由已缓存的基座模型对数概率计算,交换本身不需要额外模型前向;论文报告在LCB v5上副本交换仅占总时间的很小一部分,同时峰值显存高于单链。

作者指出早期停止的功率采样实现存在结构性截断偏差:每次后缀提议只重新生成到当前实际长度,较短候选可能满足条件而反向概率为零,精确MH规则本应拒绝却被接受,造成概率单向流向更短记录,并行回火也无法修复。 论文给出该偏差的渐近偏差下界,并提出固定视界构造——用确定性的EOS后填充让提议始终生成到统一端点,从而恢复对真实锐化目标的保持。 论文给出定理形式的TV下界与四状态示例,说明截断核既不保持目标也不收敛到目标;在Qwen3-4B与Qwen3-8B上,从截断核改为固定视界核把命中容量上限的比例从9.2%降到8.0%、从12.2%降到9.5%,同时准确率上升。

在数学、STEM与代码推理基准上,PPT在几乎所有模型—基准设置中取得最好或并列最好成绩,且不依赖参数更新或外部奖励就超过GRPO;使用Qwen3.5-9B时,PPT在GPQA、AIME 24&25与LCB v5上分别达到85.9、93.3与84.9,与所报告的前沿模型数值相当。 单链功率锐化在强模型上并不可靠——Power Sampling在多数Qwen3.5-9B基准上低于标准解码,PowerSMC在AIME 24&25上大幅落后标准解码,而PPT针对同一功率目标却从不低于标准解码。 主表覆盖Qwen3-4B与Qwen3-8B在六个基准上的对比,扩展表覆盖Qwen3.5-9B在三个最难基准上的对比;评测采用严格pass@1,不使用奖励或验证器重排。

计算量匹配的对照把增益归因于交换机制而非更多算力或更多链:把单链的MCMC步数增加到与多副本PPT相同的解码token预算后,PPT在四个基准上仍更准;关闭交换的未耦合阶梯在Pass@1与投票准确率上均低于PPT。 这区分了“多花token”与“让副本互相交换记录”两种解释,说明交换改变的是每条链的轨迹质量,而不只是采样数量。 论文报告在Qwen3-4B与Qwen3-8B上,PPT相对未耦合阶梯在MATH500、AIME 24&25与GPQA的Pass@1与Vote上全面提升;消融还显示四到五个副本后准确率趋于饱和,等接受率阶梯优于随机、等差与几何阶梯。

启示与展望

该结果面向希望在推理期、不更新参数也不使用外部奖励的条件下提升推理质量的实践者,适用于可并行运行多个副本、且能承担更高峰值显存的推理环境;论文的评测集中在数学、STEM与代码推理基准,并采用严格pass@1、不做奖励或验证器重排。方法层面,固定视界构造与交换核在给定视界下保持目标分布,交换接受率由缓存的对数概率计算,因此交换本身几乎不增加模型前向开销;阶梯设计上,等接受率阶梯在实验中优于随机、等差与几何阶梯,副本数在四到五个之后准确率趋于饱和。

论文报告Qwen3.5-9B在GPQA、AIME 24&25与LCB v5上达到与前沿模型相当的水平,但前沿模型数值标注为引用值,比较口径需要读者自行核对;PPT在提升准确率的同时峰值显存明显高于单链,多副本的显存与吞吐权衡在不同硬件上如何变化仍是开放问题;交换接受率随模型与任务变化,论文指出更新、更强的模型接受率更低,是否需要更密的阶梯仍待进一步研究;此外,收敛性定理依赖“支持性完全重启”这一充分条件,作者也说明该系数是最坏情况保证,并不保证在实际精炼预算下误差很小。

来源