RELACE用原始与结果条件双情境似然比对动作打分,在ALFWorld与WebShop上取得所比较方法中最高的平均成功率
核心概要
RELACE是一个无需评论家的框架,用冻结行为策略对已执行动作在原始情境与结果增强情境下做教师强制似然打分,将两者长度归一化得分之比在轨迹内归一化并裁剪后重加权折扣回报,再在状态匹配组内构造局部优势,与GRPO轨迹级优势结合;在ALFWorld与WebShop上使用Qwen2.5-1.5B-Instruct与Qwen2.5-7B-Instruct,其报告的平均聚合指标高于GRPO、GiGPO、HCAPO与GraphGPO等基线。
(a) ALFWorld Success Rate
arXiv深度剖析
提出显式的“原始情境对结果条件情境”动作打分机制:对同一已执行动作,用冻结行为策略在两种情境下做教师强制打分,取长度归一化得分之比,再按轨迹均值归一化并裁剪,得到回顾性相关权重。 HCAPO的实用估计器只用轨迹内平均事后得分做归一化,未显式计算每个已执行动作的原始情境分母;RELACE把原始情境得分显式纳入比值,从而区分“事后看起来合理”与“因结果信息而变得更合理”。 该机制在方法部分以公式形式完整给出,并在WebShop消融中与仅用事后得分加权的变体、仅对焦点动作加权的变体对照,报告的成功率排序支持显式原始情境校正的作用。
把回顾性权重用于重加权折扣任务回报,再在状态匹配组内比较加权回报,构造局部优势,并与轨迹级GRPO优势相加,形成无需辅助价值模型或奖励模型的细粒度信用分配。 GiGPO等状态条件方法比较的是未加权折扣回报,其目标仍反映后续动作与转移;RELACE让结果信息先进入回报目标,再做局部组比较,使焦点目标与组基线使用同一套加权、平滑后的量。 消融显示仅对焦点动作加权而基线不加权的变体表现较差,而焦点与基线一致加权的完整RELACE最好,支持该设计动机;主实验在两种模型规模、两个环境上报告了聚合指标。
引入时间平滑与“成功保护”非对称掩码来稳定局部信号:相邻步平滑把加权回报信号分享给前一个动作,掩码移除成功轨迹上的所有负向局部修正,同时保留轨迹级宏观优势不变。 这些稳定化组件沿用HCAPO的做法,但被整合进以似然比加权的回报目标之上,使局部信号在稀疏终局奖励下更可用。 方法部分给出平滑与掩码的显式定义,并说明单元素组与常数目标组得到零局部优势;训练诊断显示平均回顾权重的时间标准差从早期窗口到后期窗口下降约一个量级,事后得分均值上升。
在ALFWorld与WebShop上以Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct评估,报告的平均聚合指标在所比较方法中最高,且1.5B下相对GiGPO的早期学习曲线分离更明显。 改进不仅相对轨迹级GRPO,也相对所列的步级与事后类基线,说明回顾性似然校正可与结构化局部比较互补。 表1汇总RELACE结果与已发表基线配置(GRPO、GiGPO、GraphGPO沿用Cheng等,HCAPO沿用Tan等),并单独比较RELACE与GiGPO在共享检查点的验证历史;计算开销分析显示事后打分约占完整记录迭代时间的较小份额。
启示与展望
该工作面向部分可观测、稀疏终局奖励的多轮语言智能体训练场景,适用于希望在不引入辅助价值模型或奖励模型、也不增加自回归采样的前提下获得动作级信用的研究者与工程实践者。方法在ALFWorld与WebShop上以Qwen2.5-1.5B-Instruct和Qwen2.5-7B-Instruct验证,并给出在八卡H100节点上WebShop 1.5B的阶段性耗时画像,便于评估训练管线中的额外开销。状态匹配在实现中用字符串相似度阈值近似,因此其适用范围与可观测表示的文本形式相关。
似然得分被作者明确表述为实用信用代理而非精确的事后后验,因此这些分数代表回顾性相关性而非因果贡献,其与动作效用的关系被列为后续工作。状态匹配在部分可观测下用近似字符串匹配,匹配到的观测未必对应同一潜在状态,这一环节的稳健性仍是开放问题。正文中多处具体数值(如各基线的成功率、消融各变体的成功率、训练诊断的具体数值)在所提供的文本中缺失,因此无法在此复述精确数字;若需要精确对比,应查阅原文表格与图。此外,相对GiGPO的端到端训练耗时差异需要一次关闭事后打分的匹配运行才能确定。
