UniIntervene++ 在五项真实机器人操作任务上把平均成功率提到 89.67%,同时把人工干预率降到 0.77%
相关研究与后续进展核心概要
该工作提出 UniIntervene++,把在线强化学习策略、轨迹纠正与任务结构化 CodePolicy 建模为半马尔可夫决策过程中的 Option 并在线学习其相对价值,配合周期性无辅助探测与耦合经验学习,在五项真实机器人操作任务上取得 89.67% 平均成功率,比最佳基线高至少 6 个百分点,并把人工干预率降至 0.77%。
Fig. 1: Competence-adaptive control allocation in UniIntervene++ . Illustrative Ring Transfer rollouts show a shift from early failures with substantial use of Trajectory Correction and CodePolicy to later autonomous success with predominantly RL policy control. Colored bars indicate Option occupancy within each rollout (teal: RL policy; orange: Trajectory Correction; purple: CodePolicy). Assisted experience improves the RL policy, while Adaptive RL Probe reserves unassisted windows to assess its evolving competence and guide subsequent allocation.
arXiv深度剖析
把在线干预表述为统一控制分配问题:将演进的 RL 策略、演示引导的轨迹纠正和任务结构化 CodePolicy 放入同一决策空间,用带可用性掩码的 SMDP Double-DQN 调度器在线学习三者的相对价值。 此前的 AutoSERL 依赖单条演示的轨迹引导与预定义失败区域,UniIntervene 则用离线学到的价值退化触发离线恢复策略;本文把干预学习器移入在线循环,使进入、纠正行为与退出都由同一套演进中的价值比较决定。 方法层面给出 Option 集合、调度器状态、可用性掩码、调度器奖励与 SMDP 目标的具体形式,并说明底层沿用 HIL-SERL 的离策略目标与更新规则不变。
提出能力自适应干预:Adaptive RL Probe 周期性保留一段连续无辅助执行窗口,在窗口内强制选择 RL Option,并用投影到演示参考路径上的弧长进度与最大路径偏差判定探测是否通过,据此调整无辅助窗口长度。 探测不引入额外调度动作、奖励或价值函数,其进度、偏差与通过信号只用于更新课程,不计入调度器奖励,也不计为独立任务成功;这使控制分配依据实测执行证据而非辅助回合的成功。 给出探测通过判据的显式条件,并说明任务完成、人工接管、安全中断、路径偏差过大或进度停滞分别如何结束探测。
提出耦合经验学习:所有机器人控制转移进入在线回放缓冲,由自动辅助或人工接管产生的转移额外路由到演示缓冲,由未改动的 HIL-SERL 学习器从两个缓冲混合采样。 辅助经验直接参与 RL 策略学习,而不引入额外的行为克隆或策略蒸馏目标;调度器与 RL 策略不共享梯度,而是通过机器人控制与 Option 两个时间尺度上的数据回路耦合。 给出转移路由的显式规则,并说明调度器与 RL 学习器保持各自的网络、优化器与回放缓冲。
在 Ring Transfer、Tube Insertion、USB Insertion、Wipe Whiteboard、Towel Folding 五项真实操作任务上,UniIntervene++ 平均成功率 89.67%,人工干预率 0.77%;Ring Transfer 上 RL 策略控制份额随其独立评估成功率从零升至 88.33% 而从 35.78% 升至 90.51%。 相对最佳基线平均 83.67%(HIL-SERL 与 UniIntervene),成功率高出 6 个百分点;相对基线中人工干预率最低的 AutoSERL,人工控制步数相对减少至少 94.6%。 成功率在训练后每任务三次、每次 20 回合的评估中测量;消融在 Ring Transfer 与 Towel Folding 上比较五种配置,完整方法分别为 88.33% 与 85%,固定先验随机调度器为 75% 与 80%,去掉 CodePolicy 两者均为 0,去掉轨迹纠正为 50% 与 47%。
启示与展望
该结果面向单台 UR7e 机械臂配 Robotiq 夹爪、经 3Dconnexion SpaceMouse 提供人工纠正与安全接管的真实操作场景,覆盖精密操作、接触丰富插入与交互、可变形物体操作三类任务;报告的性能在约若干机器人交互步、对应若干分钟有效训练时间内取得,USB Insertion 用时最短、Ring Transfer 最长。方法保留人工接管作为外部安全兜底,因此适用于仍允许人工安全介入的训练流程;对希望把常规纠正与恢复交给自动辅助、只在早期不安全状态需要人工介入的团队,这一控制分配框架提供了可直接借鉴的调度器设计。
消融为系统级:去掉某个 Option 会同时改变实际执行的辅助与路由给任务策略的经验,因此各辅助来源的贡献不能完全分离;所有启用调度器的变体都保留 Adaptive RL Probe,其独立贡献未被单独隔离。成功率基于每任务三次、每次 20 回合的评估,任务级差异的稳定性有待更多重复验证。Wipe Whiteboard 上 UniIntervene++ 为 86.67%,低于 UniIntervene 的 90.00%,提示在持续工具—表面交互类任务上自适应分配与离线固定恢复的相对优势可能随任务变化。此外,探测通过判据依赖演示参考路径的弧长进度与偏差阈值,参考段近乎静止时改用更紧的局部偏差条件,这些阈值设定对结果的影响未在文中展开。
