在Dream-7B与LLaDA-8B上,匹配算力下ORM重排以最高82.71%对70.02%胜过确定性PRM引导
核心概要
该工作提出一套匹配前向传播算力的诊断协议,在Dream-7B与LLaDA-8B-Base上比较离散扩散语言模型的奖励引导推理,发现确定性top-k过程奖励模型(PRM)引导在GSM8K、MATH与MBPP上均落后于独立采样加任务匹配的结果奖励模型(ORM)重排,并把差距分解为引导造成的候选池损伤与终局选择质量两部分。
深度剖析
在统一前向传播预算下,确定性PRM引导在数学与代码任务上均不及ORM重排:GSM8K上N=8时ORM重排75.13%对PRM引导65.18%,N=32时82.71%对70.02%;MATH上30.65%对20.80%;MBPP上63.04%对50.88%。 此前PRM引导在自回归推理中有效,但离散扩散模型的快照是散乱可见位置而非前缀,该工作首次在匹配算力下系统比较引导式与重排式两种测试时算力用法。 在Dream-7B上以严格答案抽取评测GSM8K测试集,候选池含42,208条完整轨迹,前向传播计数与实测墙钟时间比值误差在约10%以内,并给出配对自助法置信区间。
差距可分解为候选池损伤与终局选择两部分:PRM的ROC-AUC随掩码率从接近解码完成时的较高值单调降至几乎全掩码时的低位;top-1剪枝把Oracle上限从81.05%降到67.30%,而SMC采样器把上限恢复到77.89%后,PRM选择的准确率仍停留在65.48%。 该分解把“引导是否有效”拆成两个可独立测量的环节,并给出离线反事实:在初始状态做top-1剪枝有46.06%的概率删掉所有最终正确的谱系。 结合掩码率分桶的ROC-AUC曲线、PRM Hybrid的Oracle上限、ESS调温SMC对照与逐步剪枝风险表,各比较均报告95%置信区间。
在同一候选池上,仅在最终状态训练的PRM与ORM重排持平(75.40%对75.13%,82.79%对82.71%),而跨掩码训练的PRM明显落后(42.84%与65.35%);MBPP上PRM对完成程序的排序已与ORM相当,其引导下的损失因此归因于引导本身。 说明跨掩码训练分散了评分器的判别力,而池化ROC-AUC高并不保证问题内的top-1排序质量。 同池重排对照、MBPP任务专用验证器对照,以及论文给出的命题说明池化判别力与问题内排序可以分离。
双向PRM优于因果PRM,且大部分差距来自读出方式:末位token池化把因果PRM在最终状态上的ROC-AUC从0.6789提升到0.7274,恢复约一半差距;LLaDA-8B-Base上双向引导平均31.64%,比因果引导高约10.87个百分点。 把架构差异与读出设计分开,指出因果奖励模型常用的末位token读出在扩散快照上更合适。 在Dream-7B与LLaDA-8B-Base两个骨干上复现,并配有更长训练与ORM协议重训对照,双向优势在全部十个掩码分桶中保持。
启示与展望
该结果面向使用离散扩散语言模型做数学与代码推理、并打算把额外测试时算力投入奖励引导的研究者与工程团队;适用场景是确定性top-k PRM引导加任务匹配验证器的匹配算力比较。论文释放了快照语料与评测工具包,使他人可以在同一协议下测量候选池损伤与终局选择,并把该分解推广到任何“用中间分数剪枝、又用同一评分器做最终选择”的搜索流程。
论文自身列出若干开放问题:领域范围仅覆盖数学与代码,创作类或开放式文本未测;LLaDA上尚未做专属ORM对照;监督信号仅用二元最终正确性标签,步骤级监督是否改变信号衰减曲线仍不清楚;读出方式只测了均值池化与末位token,[CLS]与可学习查询池化未测;引导算法只覆盖分段top-k剪枝一族,自适应分支、前瞻评分与随机束搜索留待后续;快照分布对采样超参的敏感性仍是经验问题。此外,双向优势的机制尚未唯一确定,论文提出联合无序建模、读出设计与训练分布偏移三种残余假设,并建议用排列语言模型评分器做证伪实验。
