跳到主要内容
返回时间线
arXiv来源发表:

Power-SMC 用并行候选序列与重要性权重剪枝逼近序列级幂分布,在 MATH500、GSM8K、GPQA、HumanEval 上匹配或超过 MH 采样并把推理加速至多 17.6 倍

相关研究与后续进展

核心概要

该工作提出免训练采样方法 Power-SMC,通过并行维护多条候选序列、以重要性权重衡量其与序列级幂分布的匹配程度并周期性剪除低分序列,在 MATH500、GSM8K、GPQA 和 HumanEval 上取得与 Metropolis-Hastings 采样相当或更高的准确率、保持输出多样性,同时把推理速度提升至多 17.6 倍。

Source-provided article image: Power-SMC: Low-Latency Sequence-Level Power Sampling for Training-Free LLM Reasoning
Figure 1 ·

Figure 1: Conceptual illustration of the power distribution. Left: the base model p ⁡ ( y ∣ x ) p(y\mid x) spreads probability mass across many sequences, including fluent-but-wrong ones. Right: the power distribution π α ∝ p α \pi_{\alpha}\propto p^{\alpha} ( α = 2 , 4 \alpha{=}2,4 ) concentrates mass on high-likelihood sequences. Correct solutions are amplified while lower-likelihood sequences are suppressed. Power-SMC samples sequences from π α \pi_{\alpha} without modifying model parameters.

arXiv

深度剖析

Power-SMC 直接以序列级幂分布为目标,该分布正比于模型概率的 α 次幂(α>1),从而在推理阶段实现分布锐化而无需修改模型参数。 此前达到同类锐化效果的代表性做法是 Metropolis-Hastings 采样,但其推理速度存在数量级的下降;Power-SMC 把同一目标分布的采样代价降到接近标准解码的延迟。 摘要报告在 MATH500、GSM8K、GPQA、HumanEval 四个基准上,Power-SMC 的准确率匹配或超过 MH 采样,并给出最高 17.6 倍的推理加速。

方法机制是并行保留多条候选序列,为每条序列计算重要性权重以衡量其与幂分布的匹配程度,并周期性用高分序列替换低分序列。 这把序列级采样从逐条链的接受-拒绝式过程改写为多候选并行加剪枝的粒子式过程,使采样开销更接近常规解码。 摘要明确描述了并行候选、重要性权重与周期性剪枝三项设计,并称其为免训练方法。

作者给出理论论证:在所有不依赖未来 token 的下一 token 采样策略中,采样温度 τ=1/α 唯一地消除每步权重方差。 该结论把温度取值与幂分布采样中的权重稳定性直接联系起来,为设计选择提供了唯一性论证,而非仅凭经验调参。 摘要以“证明”表述该唯一性结果,属于理论层面的论证。

作者刻画了剩余的权重不稳定来源,并引入渐进锐化调度以在仍瞄准同一幂分布的前提下减少权重塌缩。 在温度选择之外进一步处理权重退化问题,使方法在保持目标分布不变的同时提升实际可用性。 摘要说明该调度用于降低权重塌缩,并强调其仍以同一幂分布为目标。

启示与展望

该工作面向希望在推理阶段获得分布锐化效果、又不愿修改模型参数的使用者,适用于数学推理、常识数学、研究生水平问答与代码生成这类可评测的任务场景。其价值主张是在保持与 MH 采样相当或更高准确率的同时把延迟压到接近标准解码,因此最直接受益的是对推理延迟敏感、又需要强推理输出的部署环境。方法被描述为免训练,意味着它可作为现有解码流程的替换或叠加组件,而不需要重新训练或微调模型。

摘要未给出各基准的具体样本规模、评测配置、基线细节与统计显著性,也未说明 17.6 倍加速对应的模型、硬件与批处理条件,因此加速幅度与准确率优势的适用范围仍需在正文中核对。渐进锐化调度中“剩余权重不稳定来源”的具体形式、调度超参的敏感性,以及权重塌缩在何种条件下仍会出现,摘要均未展开。此外,摘要称方法保持输出多样性“不同于 RL 微调模型”,但未给出多样性度量方式与对比设置,这一比较的强度有待正文确认。

来源