用通用VLM智能体实现上下文内机器人学习:GPT-Policy框架
核心概要
该工作提出GPT-Policy——一个把现成通用视觉语言模型(VLM)通过共享的“上下文到动作”闭环接口连接到机器人工具的框架,在真实机器人上跨五类上下文(人类视频、机器人视频与动作、目标图像、自交互历史、在线人机交互)评估其上下文内学习能力,发现任务相关上下文可提升成功率并减少决策数与执行时间,但更好的任务理解并不能保证精确接触、可靠的结果验证或物理安全。
Figure 1 : In-context robot control with GPT-Policy. A general-purpose VLM combines the task instruction, initial state, and contextual information to guide robot actions. Context can include human videos, robot videos with recorded actions, goal images, human–robot interaction, and self-interaction history. The examples illustrate manipulation, interactive play, and mobile object retrieval.
arXiv深度剖析
提出GPT-Policy框架,将参数固定的通用VLM与机器人工具通过共享闭环接口连接,使模型在测试时无需梯度更新即可依据上下文选择参数化工具动作。 与以往面向专用机器人策略或具身基础模型的上下文内学习研究不同,该工作考察的是现成通用多模态智能体在无机器人专用训练、无测试时参数更新条件下的上下文利用能力。 方法层面给出了完整的问题形式化(a_t ~ π_θ(·|T,c_t,o_t,f_{t-1}))、上下文构造、结构化工具接口、位姿插值(线性插值加SLERP)、逆运动学残差约束与Ruckig时间参数化,并在附录中列出YAM、ARX X5、Morphi Kino三种平台的配置细节。
在真实机器人上,人类视频演示可在无机器人动作标签的情况下提升任务完成度:取红毛巾与取笔记本两项任务均由无上下文的0/3提升到2/3,同时平均决策数与执行时间下降。 该结果说明交互策略可以跨具身迁移,且动作标签并非上下文内学习的必要条件,补充了以往依赖机器人感觉运动轨迹或几何演示表示的演示条件控制研究。 每项任务重复三次,成功判定依据任务特定的几何与语义标准;取红毛巾决策数由96.3降至76.7、时间由24.6降至18.9分钟,取笔记本由94.0降至66.7、由24.6降至16.1分钟,但样本量小(3次试验)。
在接触敏感任务上,与视频时间对齐的机器人动作参考带来最高观测成功率:拧瓶盖为0/3、2/3、3/3,拔插插头为0/3、0/3、2/3(对应None、Robot Video、Robot Video + Action)。 相比仅提供稀疏关键帧视频,动作参考补充了中间指令位姿与夹爪切换,减少关键帧之间运动推断的歧义,使执行更贴近演示中的朝向与支撑姿态。 拧瓶盖保留205个动作样本对应13个视频关键帧,拔插插头保留131个样本对应14个关键帧;成功率提升的同时决策数与时间并未一致下降,且平均值包含失败试验。
目标图像、自交互历史与在线人机交互三类上下文下,GPT-6 Astra在对应任务上均达到3/3成功,并表现出目标落地、改变操作顺序与在线协调等行为。 这些案例显示单张目标图像可同时指定物体身份、相对位置与间距,自交互历史支持“先移开毛巾再找粉色盘子”这类中间子目标推理,在线交互历史支持轮流与指向意图的跟踪。 每项任务重复三次;自交互历史下“柠檬到粉盘”平均35.3次决策、8.1分钟,“移动探索”平均40.33次决策、25.53分钟;人机交互下井字棋平均69.7次决策、13.6分钟,指向取果平均67.3次决策、15.0分钟。
启示与展望
该工作面向在选定平台、模型与上下文条件下的小规模任务序列,适用于研究通用VLM在闭环机械臂操作中如何利用演示、目标图像与交互经验;其共享上下文到动作接口与具身适配器设计可供后续在更多平台与任务上复用,并作为检验上下文何时改善成功率、效率与恢复能力的基线。
读者仍会关注:在更大任务序列与更多平台上,上下文带来的成功率与效率增益是否稳定;动作参考在提升成功率的同时未一致降低成本的原因;双臂碰撞等安全事件在缺少碰撞检查的规划器下如何被系统性地监测与报告;以及模型自报完成与物理任务成功之间的差距如何被独立验证。此外,正文为快速解析版本,图表(图4至图8)与部分表格细节未完整呈现,这可能影响对定性比较与对齐度量的进一步判断。
