跳到主要内容
返回时间线
arXiv来源发表:

AlignOPSD 把长程智能体的监督对齐到功能决策而非时间戳,在 ALFWorld、WebShop、Search-QA 上比 GRPO 提升 5.5–8.7%

核心概要

该工作识别出长程智能体在策略自蒸馏中的“决策—时间戳错配”:特权指导所对应的决策可能出现在不同时间步,且学生的一个功能决策可能跨越多个时间步,为此提出 AlignOPSD,先用跨兄弟轨迹的功能对应关系校正特权监督,再以半马尔可夫分层信用分配在可变时长决策跨度上分配结果导向的信用,并在 Qwen2.5-3B/7B 上于 ALFWorld、WebShop、Search-QA 三个基准的八个骨干—聚合指标比较中全部优于 GRPO(提升 5.5–8.7%),其中六项排名第一。

AI-generated editorial illustration: Beyond Timestamps: Decision-Aligned On-Policy Distillation for Long-Horizon Agents

深度剖析

论文提出并刻画了“决策—时间戳错配”这一现象:时间戳局部的特权证据未必对应学生的功能决策,同一决策也可能出现在不同 rollout 的不同位置,从而同时错配监督上下文与信用时间范围。 此前智能体 OPSD 方法沿两条路线推进——用事后信息、执行反馈或特权上下文丰富教师证据,或改进教师—学生差异的过滤与聚合——但其局部信号仍锚定在学生轨迹的对应位置上,隐含假设“当前位置的教师证据适合评价该位置的功能决策”。 论文以 WebShop 上 Qwen2.5-3B-Instruct 的 100 个任务、每任务四条学生与四条特权视图 rollout(15 轮上限)做诊断:在双方均活跃且动作可解析的位置上,动作类型不同的比例为学生—学生 58.90%、学生—特权 55.06%;在严格实体—动作匹配下,79.72%(S–S)与 81.31%(S–P)的对应动作发生在不同轮次,中位位移均为 4 轮。

AlignOPSD 提出“先对齐监督、再分配信用”的两段式框架:决策对齐监督校正(Decision-Aligned Supervision Rectification)在功能匹配的上下文中对同一学生采样响应重新打分,以校准局部教师证据;半马尔可夫分层信用分配(Semi-Markov Hierarchical Credit Assignment)从对应关系变化中导出可变时长决策跨度,并用校正后的证据在跨度及其组成轮次间分配结果导向信用。 与 StepOPSD 采用以动作为中心的固定步、GEAR 从对角特权散度变化导出自适应区域不同,AlignOPSD 先解决跨 rollout 的功能对应,再由对应关系变化定义决策跨度,并在跨度与轮次两级上分配守恒的结果优势。 方法细节在正文与附录给出:冻结编码器为 Qwen3-Embedding-0.6B,相似度阈值 0.80,最多 3 个来源、每个兄弟 rollout 至多贡献 1 个来源,最大插值 0.80,无有效来源时回退到恒等差距;跨度长度限制为 2–8 轮,信用温度 0.5,边界分位数 0.80,相邻剖面距离用 Jensen–Shannon 散度。

在 ALFWorld、WebShop、Search-QA 三个基准、Qwen2.5-3B 与 7B 两个骨干上,AlignOPSD 在全部八个骨干—聚合指标比较中优于 GRPO,提升 5.5–8.7%,并在八项中六项排名第一、两项第二。 相对轨迹级 RLVR(GRPO)与步级自蒸馏(StepOPSD)均有提升,说明增益超出单纯的步级监督;由于技能条件基线共享同一 SkillBank 与检索来源,结果提示仅有特权信息并不足够,行为对齐与结果条件化的信用分配同样重要。 具体数值为:ALFWorld 平均成功率 80.5%/89.1%,Search-QA 准确率 45.1%/49.1%,WebShop Score 86.8%/87.9%(3B/7B);相对 GRPO 的提升分别为 ALFWorld 5.5%/7.9%、Search-QA 8.7%/7.1%、WebShop Score 7.0%/7.0%、WebShop Acc 5.5%/6.3%。仅两项未居首:3B ALFWorld 的 81.2% 低于 GRPO+OPSD,7B WebShop Acc 的 81.2% 低于 Skill-GRPO∗。

消融与机制分析支持两个对齐阶段各自的贡献:去掉监督校正会降低 WebShop 7B 的 Score/Acc,替换自适应跨度为 token、轮次或随机分配也均不如原方法;机制诊断显示跨 rollout 对应具有选择性、跨度长度随任务变化、校正实质改变 token 级监督。 这为“对齐监督先于分配信用”的原则提供了分阶段证据,而不只是端到端指标提升。 WebShop 7B 上,去掉校正后 Score 由 87.9% 降至 84.2%、Acc 由 78.9% 降至 71.9%;相对 token 级分配提升 6.3/7.8%,相对轮次级提升 1.6/1.6%,相对随机分配提升 9.0/9.4%。学习到的平均跨度长度为 ALFWorld 4.41 轮、WebShop 3.92 轮、Search-QA 2.24 轮;训练中跨轮来源占匹配权重的比例分别为 96.70%、83.63%、22.71%。

启示与展望

该结果面向具备可验证终端奖励、且训练期可获得特权信息的多轮交互式智能体任务,例如具身家务控制(ALFWorld)、搜索增强问答(Search-QA)与在线购物(WebShop);方法在部署时不需要特权输入,教师与学生共享同一策略参数,仅条件上下文不同。对希望改进密集监督定位的研究者与工程团队,论文提供了可复用的两段式流程(功能对应校正 + 分层信用分配)与公开代码,并给出检索 top-k、思考相似度阈值与信用温度的经验操作区间。

论文的敏感性分析基于开发历史的验证成功率曲线,作者明确说明这些曲线刻画经验操作区间而非跨随机种子的不确定性;跨度长度与功能跨度的对照目前只有聚合层面的标注,论文因此未报告边界 F1,也未声称学习到的跨度精确恢复语义目标。思考相似度作为决策状态代理的有效性由附录中的方法忠实比较审计,但保留对的平均相似度部分反映选择准则本身。此外,本次读取为全文,但表格与图以文本形式呈现,个别数值的图形细节无法从文本完全还原。

来源