FOCUS 用 KL 引导的模态切换把特权状态训练迁移到 RGB-D 策略,五个 IsaacLab 操作任务平均测试成功率从 0.71 提升到 0.93
核心概要
FOCUS 是一个单阶段 PPO 框架,让 critic 始终使用特权状态、actor 在特权状态与 RGB-D 潜变量之间按跨模态动作分布 KL 散度自适应切换 rollout 来源,并配合表征对齐;在五个 IsaacLab 操作任务上,相对各任务最强的 RGB-D 测试基线,平均测试成功率从 0.71 提升到 0.93,端到端预算归一化训练成功率 AUC 从 0.47 提升到 0.65。
Figure 1: Overview of FOCUS. During training, cross-modal policy disagreement is aggregated into running statistics that determine the RGB-D exposure probability λ r \lambda_{r} for subsequent actor rollouts. A KL-guided rollout switch samples either the privileged-state or RGB-D pathway and keeps the selected pathway fixed throughout the rollout, while the critic remains anchored to privileged state. At inference, privileged state and the switching mechanism are removed, and the actor operates only from RGB-D, proprioception, and the previous action.
arXiv深度剖析
FOCUS 把特权状态到 RGB-D 的迁移做成单阶段 PPO 训练:critic 锚定特权状态做价值估计,actor 的 rollout 由 KL 引导的开关在特权状态潜变量与 RGB-D 潜变量之间选择,且每个 rollout 内模态固定。 与把特权教师训练和视觉学生迁移分成不同阶段的 teacher-student/蒸馏流程不同,FOCUS 在同一次 PPO 运行内在线完成过渡,并用跨模态策略分歧决定哪条观测通路产生 on-policy 经验。 方法在正文第 3 节给出完整公式化描述,附录 A 给出训练算法,附录 B 给出 KL 引导切换的曝光加权界分析,附录 K 列出实现默认值。
KL 引导的模态切换用同一策略在特权状态与 RGB-D 输入下动作分布的 KL 散度决定 RGB-D rollout 概率,并用上分位 KL 预算在仍有少量高分歧状态时压低 RGB-D 曝光。 相对固定 ramp 或仅用均值 KL 的变体,上分位预算抑制了对罕见高分歧状态的曝光;消融显示固定 ramp 在 Pick-and-Place 的归一化 AUC 为 0.361,低于 FOCUS 的 0.612,在 Push-Cube 测试成功率为 0.822,低于 0.850。 消融在三个更具区分度的任务上报告;附录 B 的命题 1 给出曝光加权均值与分位失配的界,并说明实现使用滞后运行统计量近似该界。
表征对齐通过冻结 actor 与融合模块、只更新 RGB-D 编码器来降低跨模态策略分歧,使匹配的特权状态与 RGB-D 输入诱导相近动作分布。 该策略输出对齐项与 KL 开关监测的方向性分歧对应,把表征学习直接绑定到动作选择层面,而不仅是潜空间相似度。 附录 C 给出对齐目标的完整分解(对齐目标正则、原始潜变量正则、策略条件对齐、可选解码);附录 B.4 的引理 1 在共享协方差高斯策略与局部 Lipschitz 假设下给出 KL 对融合输入失配的敏感性界。
在五个 IsaacLab 操作任务上,FOCUS 相对各任务最强的 RGB-D 测试基线把平均测试成功率从 0.71 提升到 0.93,端到端预算归一化训练成功率 AUC 从 0.47 提升到 0.65;Pick-and-Place 测试成功率从 0.47 到 0.86,AUC 从 0.12 到 0.61。 AUC 按完整训练流程计算,FOCUS 计入特权状态与 RGB-D 两类 rollout,teacher-student 计入教师 PPO、RGB-D 蒸馏与学生 PPO 微调,因此比较覆盖端到端预算而非仅最终学生阶段。 每个方法用两个训练种子训练、每个检查点用五个评估种子评估,测试为固定 9000 步评估 rollout 的成功率;作者指出 states-only 是特权可观测性参考而非上界,且两个训练种子下其方差较大。
启示与展望
该工作面向仿真中可获取特权状态、测试时只能使用 RGB-D、本体感受与上一动作的 PPO 操作设定,任务为 IsaacLab 的 Reach-Cube、Lift-Cube、Push-Cube、Open-Drawer 与 two-block Pick-and-Place,仿真 100Hz、控制 50Hz、回合 5 秒。它解决的是特权状态到 RGB-D 的观测落差,与 sim-to-real 落差正交;外观偏移、传感噪声、标定误差、延迟与动力学失配仍需专门的 sim-to-real 方法或真机微调。作者建议后续在物理机器人、更广操作任务集与更少人工设计的训练信号上评估,并用更多任务与种子覆盖来区分辅助对齐组件何时必要、轻量 FOCUS-simple 核心何时足够。
评估限于仿真、较短时程操作与两个训练种子,作者明确把消融解释为组件级趋势而非关于哪些辅助损失必要的普遍结论;部分运行收敛到局部成功但次优的行为,方法对任务特定奖励工程敏感。states-only 参考在 Lift-Cube 上方差较大,作者不把 FOCUS 在该任务上更高的均值成功率解读为 RGB-D 本质上优于特权状态;非对称 actor-critic 基线在部分任务上不稳定,当前评估未分离其原因。FOCUS-simple 在三个区分度任务中的两个上匹配或超过完整版,因此哪些辅助对齐项在何种任务下必要仍是开放问题。此外,正文表格中部分消融数值在加载文本中未完整呈现,若需逐项比较应查阅原文表格。
