跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

UniIntervene++ 在五项真实机器人操作任务上把平均成功率提到 89.67%,同时把人工干预率降到 0.77%

该工作提出 UniIntervene++,把在线强化学习策略、轨迹纠正与任务结构化 CodePolicy 建模为半马尔可夫决策过程中的 Option 并在线学习其相对价值,配合周期性无辅助探测与耦合经验学习,在五项真实机器人操作任务上取得 89.67% 平均成功率,比最佳基线高至少 6 个百分点,并把人工干预率降至 0.77%。