RoboDawn 用离散动作接口让冻结 VLM 零样本操控机器人,单条示范把 RoboTwin 2.0 C2R 成功率从 53.2% 提到 73.6%
核心概要
该工作提出 RoboDawn,把机器人控制暴露为平移、旋转、夹爪三类离散语义命令,让参数冻结的 VLM 以闭环方式观察—推理—执行—再观察,并配合上下文学习示范;在 RoboTwin 2.0 C2R 上零样本成功率 53.2%、单条示范 73.6%,在 RoboDojo 上从 35.67% 提升到 47.17%,同一框架还零样本迁移到 Franka 真机完成取放与堆叠。
深度剖析
RoboDawn 把机器人操作表述为闭环视觉决策:VLM 反复观察当前视觉状态、推理下一步动作、执行并依据结果调整后续决策,动作空间是平移、旋转、夹爪三类离散语义原语,而非低层连续控制。 与依赖大规模机器人数据训练动作映射的 VLA 与世界动作模型不同,这里不更新 VLM 参数,而是通过一个对人类直观、贴近游戏与遥操作抽象的动作接口来释放已有能力。 论文给出完整命令语法,说明平移与旋转幅度被裁剪、以夹爪交互点定义位姿增量,并强调在线控制不依赖特权物体位姿;在 RoboTwin 2.0 C2R 的 50 个双臂任务上每任务做 10 次独立评测。
接口对齐的上下文学习方案用少量示范同时锚定原语语义与任务级策略,且无需参数更新;单条示范即带来显著增益。 示范被改写为语义命令序列,并拆分为共享命令入门示例与任务级示范两层,还通过稀疏化把长程轨迹的上下文图像预算控制在每轮 16 张观测以内。 RoboTwin 2.0 C2R 上 GPT-6 Astra 从零样本 53.2% 升至单条示范 73.6%;RoboDojo 从 35.67% 升至 47.17%;消融显示 Gemini-3.8-Flash 从 47.0% 到 62.2%,四条示范 65.4%,八条回落到 62.7%。
性能随底层 VLM 能力与测试时命令预算增长,呈现测试时扩展行为。 这提示同一接口下更强模型可直接转化为更高成功率,且额外交互计算可被转化为任务成功,而非仅靠扩大机器人数据。 单条示范下成功率随模型从 GPT-5.6-Luna 的 14.4%、GPT-5.6-Sol 的 43.2%、Gemini-3.8-Flash 的 62.2% 升到 GPT-6 Astra 的 73.6%;RoboDojo 单条示范从 60 条命令的 31.2% 升到 240 条命令的 47.2%,零样本从 23.7% 升到 35.7%。
同一框架零样本迁移到真机,但不同任务难度差异明显。 真机结果说明该接口不局限于仿真,同时暴露出旋转与精细放置类操作更困难。 Franka 上取物入篮 9/10、积木堆叠 5/10,Piper 上折布 0/10;作者把折布困难归因于涉及大量末端旋转与姿态调整,并提到存在若干接近成功但最终折叠不够整齐的试验。
启示与展望
该工作面向的是高层操作决策:作者明确把低层灵巧性与高频控制留给其他方向,认为 RoboDawn 更适合作为高层决策引擎。适用对象是希望在不做任务特定参数更新的前提下,把已有 VLM 用于操作任务的研究者与工程团队;适用场景包括 RoboTwin 2.0 C2R 这类从干净场景泛化到随机场景的评测、RoboDojo 的通用操作评测,以及 Franka 上的取物入篮与积木堆叠。上下文学习方案不假设固定示范数量,零样本、单条与少样本对应同一套接口,因此示范预算可按任务难度调整。
推理效率是明确的开放问题:RoboDawn 单次推理 9.74 秒、平均 3.4 条命令、运动 2.09 秒,推理与运动比 4.65,作者指出这使其不适合要求高频控制的场景。自由度难度不均也仍待解决:VLM 对平移的把握优于精确的臂部与末端旋转,上下文学习只能缓解而不能消除差距。精细交互控制同样受限,离散语义接口在接触、抓取与放置附近的细微调整上偏粗。真机折布 0/10 与作者对旋转类动作在网页规模预训练数据中表征较少的推测,提示这类任务仍是开放方向。此外,RoboDojo 的失败分析列出三类模式:操作精度不足、与逆运动学相关的执行误差导致碰撞、以及模型对任务完成的判断与基准成功标准不一致。本总结基于论文全文,未包含图表中的逐项数值细节。
