跳到主要内容
返回时间线
arXiv来源发表:

GraphOPD 用环境状态转移依赖图重排蒸馏监督,在 ALFWorld 与 WebShop 上超过最强基线最多 +5.8 个百分点

核心概要

GraphOPD 从环境状态转移中读取步骤间的依赖关系,构建有向依赖图并用随机游走平稳分布给出每步的结构信用分,再与教师-学生散度信号融合成轨迹相对的掩码,只对每条 rollout 中适应度高于自身均值的步骤施加蒸馏监督;在 ALFWorld、WebShop、SearchQA 三个基准、三种模型规模和十一个基线上均具竞争力,相对最强基线最多提升 +5.8 个百分点。

Source-provided article image: GraphOPD: Graph-Augmented On-Policy Distillation for LLM Agents
Figure 1 ·

Figure 1: Motivating empirical study. All runs distill only the k k highest-KL steps or k k randomly chosen steps per trajectory, k ∈ { 5 , 8 , 10 , 12 } k\in\{5,8,10,12\} , on ALFWorld with a 7B Qwen2.5-Instruct agent under GRPO for 150 steps, all other conditions identical. ( Left ) Random selection stays ahead at every budget k k , by + 1.5 +1.5 to + 3.2 +3.2 pp in success rate, with the per-budget gaps Δ \Delta annotated above each pair. ( Middle ) At k = 5 k=5 the KL-guided run trails in success rate (solid curves, left axis) throughout and ends at 76.3% against 83.5% for random, while its policy entropy (dashed curves, right axis) contracts as the random run’s expands. ( Right ) The per-step KL of 466 successful and 466 failed steps from 50 rollouts overlaps by 84% between the two outcomes, with medians (dashed) at 0.10 and 0.09, so success and failure are barely separable by divergence.

arXiv

深度剖析

论文先检验了现有 on-policy 蒸馏按教师-学生散度大小分配监督的规则,发现在多轮智能体轨迹上该规则失效:只蒸馏最高 KL 的步骤相对随机选择没有稳定收益,散度引导的规则在整个训练中落后于随机选择,且成功与失败步骤在散度上几乎不可分。 此前工作把单轮直觉——散度大即代表值得纠正的错误——直接搬到多轮智能体场景,本文用受控对比说明该前提在长程轨迹上不成立,从而把监督分配问题重新定义为需要一种不受漂移影响的信号。 在 ALFWorld 上以 7B Qwen2.5-Instruct、相同 GRPO 骨干与训练配置做选择对比,最高 KL 与随机选择各训练 150 步;结果层面用 50 条 rollout 提供 466 个成功步骤与 466 个失败步骤做对比。

GraphOPD 从环境自身的状态变化记录中读取哪些步骤使能了哪些后续步骤,构建每步一个节点的有向依赖图,用带阻尼与均匀跳转的随机游走平稳分布给出结构信用分,并与散度信号加权融合为蒸馏适应度,再在轨迹内标准化成软掩码。 作者称这是首个把基于图的结构增强引入智能体 on-policy 蒸馏的方法;此前的图或分支信用分只用于重加权 RL 优势,蒸馏损失本身不加权,而本文直接为蒸馏损失表示后续步骤真正依赖哪些步骤。 依赖边由规则化的 State Transition Footprint 从动作与观测文本抽取,按实体稀有度加权,无需 LLM 调用、特权标注或 rollout 反事实;附录给出平稳分布存在唯一性与幂迭代收敛率的证明,并测得图构建占每训练步耗时不到 0.5%。

在 ALFWorld、WebShop、SearchQA 三个基准、三种模型规模与十一个基线上,GraphOPD 全程具竞争力,在 ALFWorld 与 WebShop 每个规模都取得最佳结果,7B 时达到 91.9% ALFWorld 成功率与 83.6% WebShop 成功率,相对最强基线最多提升 +5.8 个百分点。 相对同样使用图结构信用分但只重加权 GRPO 优势的 GEPO,在 ALFWorld 上领先 +5.2 至 +7.9 个百分点、WebShop 成功率上领先 +3.6 至 +5.5 个百分点;相对 SDAR 在 1.7B 上 ALFWorld +12.0 个百分点、WebShop +13.5 个百分点。 GraphOPD、SDAR、OPID、GEPO 各做三次独立运行,GraphOPD 自身最大标准差为 1.60 个百分点,九个头条单元中有七个低于 0.6 个百分点,而最大基线标准差约 5 个百分点;其余行为单次运行点估计。

消融显示两个信号互补且各自必要,结构信用分是更大的单一贡献者;执行回放审计显示结构信用分与真实因果影响的 Spearman 相关为 0.58、Hit@10% 为 0.48,明显高于随机基线,也高于散度信号;同一信号还迁移到域外的工具集成推理。 Shuffled Centrality 控制在保持掩码稀疏度与权重分布的前提下打乱权重归属,在 7B 以及 3B 的 WebShop 与 ALFWorld 上损失比 Divergence-only 还多最多 1.6 个百分点,说明收益来自结构信用的内容而非非均匀加权本身。 审计对训练后 7B 策略的 30 条轨迹每条采样 10 个决策步、每步重采样 4 个替代动作并向前滚动到时间上限;域外测试在 AIME24、AIME25、LiveCodeBench-v5、GPQA-Diamond 上以 Qwen2.5-7B-Instruct 做工具集成推理,平均 29.0% 对 SDAR 的 20.0%。

启示与展望

该结果面向以文本接口与环境交互、奖励仅在轨迹末端给出的多轮智能体后训练场景,适用于 ALFWorld 式具身操作、WebShop 式网页购买与 SearchQA 式检索问答,以及以 Python 解释器为工具的工具集成推理。方法以 GRPO 为骨干、以学生自身冻结快照为教师,作为训练循环的即插即用重加权,不修改优化器与 rollout 基础设施,也不需要额外模型调用。对希望降低步级监督分配试错成本、或已在用散度加权蒸馏的团队,可直接替换监督分配规则;对需要跨域迁移的团队,只需为新环境提供规则化的 Footprint 抽取器。

结构信用分依赖规则化的 Footprint 抽取器,作者把用 LLM 直接从原始轨迹抽取 Footprint 列为自然的下一步,因此在新动作空间上的可迁移性取决于抽取器能否覆盖该空间的实体与状态键。软掩码在字面上不排除任何步骤,其有效集中度取决于轨迹内适应度分布形状,作者报告在两条记录 rollout 上高于均值步骤的平均权重约为低于均值步骤的两倍、极端步骤相差最多七倍,并指出预算匹配的硬掩码变体是留给未来的自然消融。审计在 30 条轨迹、每条 10 个决策步上进行,域外迁移只在 7B 规模与四个基准上验证。此外,表 1 中除 GraphOPD、SDAR、OPID、GEPO 外的行均为单次运行点估计,读者在比较这些行时需注意其方差信息缺失。

来源