POISE 用模型自身内部状态预测价值基线,在六领域可验证奖励语料上超过 GRPO 与 PPO 并训练更稳定
核心概要
该工作提出 POISE(Policy Optimization with Internal State Value Estimation),用一个轻量探针读取前向传播中已计算的内部状态来预测价值基线,并采用跨 rollout 构造让每个 rollout 的价值由另一条独立 rollout 的内部状态预测以保持梯度无偏;在 Qwen3-4B 与 OLMo3-7B-Instruct-DPO 上、跨六领域可验证奖励语料,POISE 优于其他 RLVR 基线且训练更稳定,探针可匹配独立的 LLM 规模价值模型、泛化到多种任务并随策略规模扩大保持准确。
Figure 1 : Estimated policy-gradient variance under a fixed total rollout budget. The m = 1 m=1 condition allocates one rollout to each of B B distinct prompts, whereas the m = 8 m=8 condition allocates eight rollouts to each of B / 8 B/8 prompts.
arXiv深度剖析
POISE 把大推理模型的内部状态直接当作价值模型使用:一个轻量探针读取前向传播中已经计算出的信号来预测基线,并与策略在线共同训练。 相对 GRPO 以同一 prompt 多次 rollout 的组均值估计基线、PPO 另训一个策略规模 critic 的做法,POISE 复用模型自身已算出的表示,避免在基线准确性与批内 prompt 多样性之间取舍,也避免 critic 带来的额外训练开销。 摘要给出算法机制与训练方式(探针在线训练),并在 Qwen3-4B 与 OLMo3-7B-Instruct-DPO 两个模型、六领域可验证奖励语料上报告相对其他 RLVR 基线的优势与更稳定的训练。
为保持梯度无偏,作者引入跨 rollout 构造:每个 rollout 的价值由另一条独立 rollout 的内部状态来预测。 这是把内部状态用作价值估计时针对无偏性问题的专门设计,区别于直接用同一 rollout 自身状态预测其价值。 摘要明确陈述该构造的目的为“preserve gradient unbiasedness”,但未给出该构造的消融或定量对比细节。
探针在能力上可匹配一个独立的 LLM 规模价值模型,能泛化到多种任务,并随策略规模扩大保持准确。 说明内部状态所携带的价值信号足以替代单独训练的大规模价值模型,从而在保持基线质量的同时不引入第二个大模型。 摘要以“matches a separate LLM-scale value model”“generalizes to various tasks”“remains accurate as the policy scales”三项陈述支持,未给出具体数值或规模点。
启示与展望
该结果面向使用可验证奖励训练大推理模型的研究与工程场景,尤其是需要在一个批次内混合多领域 prompt 的通用推理训练。它使读者可以在不额外训练策略规模 critic 的前提下获得价值基线,并让探针随策略在线更新;摘要所述验证覆盖 Qwen3-4B 与 OLMo3-7B-Instruct-DPO 以及六领域可验证奖励语料,因此其适用范围应理解为可验证奖励设定下的多领域训练,而非开放式、无自动验证信号的奖励场景。
摘要未给出具体基准数值、训练预算对比、探针规模与结构、跨 rollout 构造的消融,也未说明六领域语料的具体构成与评测指标;探针“随策略规模保持准确”所覆盖的规模范围同样未在摘要中展开。读者若关心这些量化细节,需要查阅正文的表格与实验设置。
