强智能体把干预经验写成手册交给轻智能体,真实机器人操作成功率从37.3%升到64.0%
核心概要
该工作提出递归式工具带蒸馏(RHD):让强智能体(GPT-6 Astra)先与冻结的视觉-语言-动作模型交互,把有效干预策略写成可复用的“手册”,再用轻智能体(GPT-5.6 Luna)的执行反馈递归修订手册,从而在不更新任何模型参数的前提下提升操作表现——真实世界操作成功率由37.3%提升至64.0%,在SimplerEnv Bridge上轻智能体带手册达到66.7%(GR00T单独为41.7%),同一手册也让强智能体达到79.2%。
深度剖析
提出把“如何干预已部署VLA”的经验外化为可复用手册,并由强智能体递归修订的框架RHD。 以往工作让语言模型生成机器人程序或把学习到的策略当作可调用工具,但没有说明有效的干预策略如何被积累并跨智能体迁移;RHD把蒸馏对象从模型参数改为外部指导,且修订依据是接收方智能体实际执行产生的反馈。 论文给出问题形式化、三类干预位点(指令、注意力、动作输出)的接口定义,以及基于有限时域性能差恒等式的目标刻画;修订通过完整接收方 rollout 的任务结果来评估,而非仅复现教师自身轨迹上的决策。
在SimplerEnv Bridge上,带手册的轻智能体超过不带手册的强智能体,且同一手册也提升强智能体。 论文报告GR00T单独为41.7%,仅加轻智能体(无手册)为43.8%,带精炼手册的轻智能体为66.7%,强智能体带同一手册为79.2%;说明收益来自手册而非单纯增加一个智能体。 四个WidowX任务(spoon-on-towel、carrot-on-plate、cube stacking、eggplant-in-basket),开发与评估各12个初始配置、每划分48个实例,评估用被排除在构建过程之外的初始配置,且每个评估用手册被冻结。
真实机器人上,手册把轻智能体的总体成功率从37.3%提升到64.0%,而无手册的轻智能体为0%。 论文指出仅有干预工具并不足以控制物理机器人:无手册时轻智能体难以补偿“预期交互位置与机器人实际运动之间的反复空间偏移”,改指令或改注意力都不能可靠解决;手册由Astra从GR00T衍生手册适配到物理任务与微调策略。 7自由度Franka Panda,三个任务(Cube-to-Tray、Cube Stacking、Button Pressing),每任务50条人类遥操作示范用于微调,评估每任务25次试验、共75次,评估时每次试验前随机化物体位置。
递归精炼本身是收益来源,且教师能力层级重要:轻智能体自任教师时收益消失。 初始手册反而把轻智能体成功率从43.8%降到31.3%,精炼后升到66.7%;以Luna为教师、Luna为接收方时精炼手册仅22.9%,低于无手册的43.8%,而Astra为教师时为66.7%。 两组对比使用相同开发划分、接口、手册长度上限以及开发 rollout 与修订尝试次数上限;论文还报告精炼在四个任务上均提升成功率,且多数任务中相对初始手册降低了每回合平均 token 用量。
启示与展望
该结果面向需要在变化场景中反复部署冻结VLA的机器人操作场景:前提是存在可暴露指令、内部注意力与动作输出的干预接口,并有一个强智能体负责初始蒸馏与后续修订。论文在SimplerEnv Bridge的四个WidowX任务与Franka Panda的三个真实任务上验证,真实任务使用每任务50条遥操作示范微调后的策略,评估每任务25次试验。对希望降低推理成本、又不想重新训练策略的团队,这提供了一条“经验外化为手册、跨智能体复用”的路线;论文也报告精炼在多数任务中降低了每回合平均token用量。
手册的收益依赖强智能体作为教师:以轻智能体自任教师时精炼手册仅22.9%,低于无手册的43.8%,因此教师能力层级的作用值得继续观察。论文的接受规则是“首个满足目标的候选被接受”,并说明该规则不保证终止,这使修订轮数与最终手册质量的关系仍是开放问题。真实世界手册由Astra从GR00T衍生手册适配而来,跨策略、跨平台的迁移范围尚待检验。此外,本次载入的是论文全文与外部报道,未包含图表中的逐任务数值细节,因此各任务层面的具体差异无法在此逐一核对。
