跳到主要内容
返回时间线
arXiv来源发表:

APPL 把技能的结构先验同时用作训练偏置与运行时接口,在 MetaWorld 上把少样本 OOD 成功率从 37.9% 提到 89.6%,并在 ManiSkill 上解出 8/16 个未见技能组合

核心概要

该工作提出 Agent Priors-guided Policy Learning(APPL):由一个构建智能体把完整演示切分为可复用技能、为每个技能提出多个结构先验并各训练一个 Diffusion Policy,再把同一先验写成运行时接口,由运行时智能体据此选择与组合冻结策略;在六个 MetaWorld 任务上,两次演示下的 OOD 成功率由固定关系先验的 37.9% 提升到 89.6%,在五个长程 ManiSkill 任务上,物体位置偏移下成功率为 50.0%(全任务 Diffusion Policy 为 10.0%),任务级变体为 92.5%,并解出 16 个未见技能组合中的 8 个,而隐藏接口信息后成功率显著下降。

AI-generated editorial illustration: Agent Priors-guided Policy Learning

深度剖析

论文把每个技能策略的“结构先验”同时用于两处:训练时通过表示、动作参数化、架构或辅助损失塑造策略的泛化范围,运行时把同一先验连同交接条件、训练支撑与验证证据写进接口,供运行时智能体判断该策略在何处适用。 此前工作要么把结构先验只用于训练(如 LGA、KALM 各自动化一类先验、每任务只产出一个设计),要么在组合层只用技能名称、指令或符号算子描述技能,从而丢失策略的结构信息;APPL 让同一先验跨越两层。 论文以形式化方式给出接口的忠实性与信息量条件,并在两个实验套件中通过消融(隐藏接口信息、隐藏先验信息、去掉高层智能体、去掉验证)比较同一冻结策略库下的表现。

在六个 MetaWorld 任务、每个任务 20 条演示的少样本设定下,智能体设计的先验显著提升分布外技能泛化:两次演示时 APPL 的 OOD 成功率为 89.58%,而 vanilla Diffusion Policy 为 28.96%、固定关系先验为 37.92%。 相对固定关系先验,APPL 在 1、5、10、20 条演示下分别高出 51.67、50.83、41.04、36.88 个百分点;且较大演示数下各方法 IID 成功率相近,说明增益来自泛化而非拟合。 六个任务、四档演示数、每任务–条件训练六个系统共 144 个模型,测试用 20 个 IID、40 个 C、40 个 E 状态,报告 95% 分层自助法区间;作者说明区间以已训练模型与这六个任务为条件,不衡量训练种子或独立智能体设计的波动。

在五个长程 ManiSkill 任务、每个任务 12 条演示的设定下,APPL 在物体位置偏移的 8 个冻结布局上成功率为 50.0%,全任务 Diffusion Policy 与单先验基线均为 10.0%;任务级变体(中途恢复或请求提前终止)成功率为 92.5%。 这是系统级比较,同时包含运行时智能体调度与更大的、由多样先验训练的技能策略库;论文明确说明该比较不单独分离调度与库规模的作用。 每任务 8 个运动级 OOD 布局、8 个任务级案例、16 个组合案例,配对 McNemar 检验;脚本规划器完成全部任务级与组合案例以及 40 个运动级布局中的 37 个。

保留同一套已验证策略库但隐藏接口信息时,运动级 OOD 成功率从 50.0% 降到 20.0%,任务级从 92.5% 降到 65.0%,组合从 8/16 降到 2/16;把运行时智能体换成固定规则则为 22.5%、52.5%、1/16。 这组消融把训练好的策略库固定,只改变运行时暴露的信息,从而把收益归因于接口信息与在线策略选择,而非策略本身。 论文报告配对胜负计数与 p 值(如对 w/o interface information 的运动级 OOD 为 17 胜 5 负,p=0.017;组合为 6 胜 0 负,p=0.031),并指出恢复验证分数与退出条件可挽回大部分运动级增益,而先验、交接与支撑描述对任务级变体贡献更大。

启示与展望

该结果面向从少量完整演示中学习可复用技能、并在物体位置变化或任务变体下组合这些技能的仿真操作场景,适用于具备结构化状态观测、可切分演示与共享逆运动学接口的设定。它使后续工作可以在此基础上改进验证协议(例如与部署状态和交接规则对齐的验证)、通过定向数据采集或增强扩展技能支撑,并接入运动规划器等互补工具;对读者而言,这意味着“策略为何泛化”的信息可以在学习之后继续被下游智能体使用,而不必在训练结束时丢弃。

论文自身指出,结构先验描述的是预期泛化而非能力保证,策略仍可能在演示支撑之外失败,当前技能库也不足以支持恢复;验证只在演示的进入状态上进行,可能对偏移下的策略排序产生误导(如 covered peg assembly 中成功率从 8/8 降到 1/8)。常见失败来自物体掉落、抽屉被推回关闭,或技能在其训练进入条件之外被调用,而演示中不含恢复轨迹。评估方面,任务级成功采用执行器在首次满足目标时即中断的停止规则,因此衡量的是目标达成而非无辅助的自主停止或持续稳定性;运动级 OOD 划分是在看到更难划分的结果后通过减半越界位移确定的。此外,重跑基于语言模型的智能体可能产生不同的策略设计与运行时决策,精确数值一致性还取决于软硬件环境。

来源