arXiv 2026年10月5日该工作提出 UniIntervene++,把在线强化学习策略、轨迹纠正与任务结构化 CodePolicy 建模为半马尔可夫决策过程中的 Option 并在线学习其相对价值,配合周期性无辅助探测与耦合经验学习,在五项真实机器人操作任务上取得 89.67% 平均成功率,比最佳基线高至少 6 个百分点,并把人工干预率降至 0.77%。该工作提出 UniIntervene++,把在线强化学习策略、轨迹纠正与任务结构化 CodePolicy 建模为半马尔可夫决策过程中的 Option 并在线学习其相对价值,配合周期性无辅助探测与耦合经验学习,在五项真实机器人操作任务上取得 89.67% 平均成功率,比最佳基线高至少 6 个百分点,并把人工干预率降至 0.77%。UniIntervene++ 在五项真实机器人操作任务上把平均成功率提到 89.67%,同时把人工干预率降到 0.77%该工作提出 UniIntervene++,把在线强化学习策略、轨迹纠正与任务结构化 CodePolicy 建模为半马尔可夫决策过程中的 Option 并在线学习其相对价值,配合周期性无辅助探测与耦合经验学习,在五项真实机器人操作任务上取得 89.67% 平均成功率,比最佳基线高至少 6 个百分点,并把人工干预率降至 0.77%。该工作提出 UniIntervene++,把在线强化学习策略、轨迹纠正与任务结构化 CodePolicy 建模为半马尔可夫决策过程中的 Option 并在线学习其相对价值,配合周期性无辅助探测与耦合经验学习,在五项真实机器人操作任务上取得 89.67% 平均成功率,比最佳基线高至少 6 个百分点,并把人工干预率降至 0.77%。