冻结世界模型特征对齐让0.8B机器人策略在LIBERO达97.9%、RoboCasa-GR1提升2.3个点且推理零开销
核心概要
该工作提出一种把世界模型表征蒸馏进紧凑视觉-语言-动作(VLA)策略的方法:在普通VLA训练中增加一个对缓存冻结世界模型特征的余弦对齐项,教师只在训练前离线运行一次、训练中不加载、投影器训练后丢弃,部署策略与未蒸馏基线完全一致;0.8B学生在LIBERO四套件平均成功率97.9%(比同架构未蒸馏学生高2.6个点),在RoboCasa-GR1人形操作上从48.2%提升到50.5%,并在单臂与双臂真实平台上取得提升,且该增益在更换学生规模、骨干、对齐层与教师后依然存在。
深度剖析
提出一种零推理成本的表征蒸馏配方:在标准VLA动作目标之外,只增加一个对冻结世界模型逐视角池化图像token特征的余弦对齐项,教师特征离线缓存、训练时不加载教师权重、对齐投影器训练后丢弃,部署图与未蒸馏基线完全相同。 以往把世界模型用作策略需要在线滚动未来,代价高昂(文中称DreamZero在H100上每次推理需3秒、占45.9GB,而该学生策略在消费级RTX 5090上为32毫秒、1.86GB);该工作把“世界模型知道什么”与“生成未来”分开,只继承内部特征而不承担生成开销。 方法在LIBERO、RoboCasa-GR1两个仿真基准和AgileX Nero单臂、TRIP-Bag双臂两个真实平台上验证;作者称教师缓存约需四张GPU一小时(LIBERO),并明确说明训练中不使用教师动作目标,因为教师与学生不共享动作参数化。
蒸馏后的0.8B学生在多个基准上超过同规模未蒸馏对照,并接近更大模型:LIBERO四套件平均97.9%±0.5,比同架构未蒸馏学生(95.3%±0.7)高2.6个点;RoboCasa-GR1从48.2%±2.1提升到50.5%±2.3,提升2.3个点。 该增益使0.8B策略在RoboCasa-GR1上超过QwenFAST、QwenPI、QwenOFT以及两个Isaac-GR00T版本,并接近4B QwenGR00T(54.8%±2.0),而后者参数量约为其五倍;作者强调对比中“同规模比较最锐利”,表中所有低于0.8B的其他策略介于78.7%与88.8%之间。 作者对每个检查点用两个评估种子乘两张GPU(A100-80GB与RTX 5090)共四次评估并报告均值与标准差,指出LIBERO波动约1至1.5个点、RoboCasa-GR1在换GPU时可移动数个点;RoboCasa-GR1的消融因算力有限只在A100上评一次。
真实机器人上同一模式成立,且增益随任务难度变化:单臂水果抓放中蒸馏0.8B策略达93.3%,与4B对照策略持平、比未蒸馏对照高10次试验;鸡蛋任务中未蒸馏对照降至46.7%,蒸馏恢复到60.0%;双臂水果交接中未蒸馏为40.0%、蒸馏为46.7%、4B对照为53.3%。 作者把水果任务从单臂迁移到TRIP-Bag双臂平台并重建为双手交接,同时改变本体、手臂数量、相机与控制器延迟,用以检验增益是方法属性还是特定装置属性;失败模式被描述为放置误差而非识别误差,鸡蛋任务还出现抓取滑落。 每个策略、任务、平台评100次试验,成功要求所有物体最终进入目标容器;单臂任务用约30分钟遥操作示范微调,双臂任务用约1小时。
消融显示该配方对自身设计选择具有鲁棒性:在0.8B、1B(InternVL骨干)、4B(Qwen3-VL骨干)三种学生上均有效(分别50.3→52.8、50.9→53.3、56.8→58.4);对齐层从L8到最终层各选择都稳定训练且落在最佳四点以内;三种教师(Cosmos3-Nano、Fast-WAM、V-JEPA2-AC)都把同一学生从95.3%提升到96.5%至97.9%。 作者据此把迁移信号归因于“世界模型表征这一大类”而非某个特定教师或两个网络间的脆弱对齐;对齐层扫描在RoboCasa-GR1上只跑四分之一训练预算,作者明确表示只解读排序、不解读绝对数值。 教师消融在LIBERO上进行以复用已有预训练教师;作者指出最佳与次佳对齐层之间的差距小于四分之一长度训练所能分辨的程度,因此保留最终层,理由是它也是动作头已消费的表征、实现最省。
启示与展望
该结果面向希望在消费级硬件上部署紧凑机器人策略的研究者与工程团队:配方适用于已有冻结世界模型、且能离线预计算教师特征的场景,教师与学生可以处于不兼容的运行环境,一份缓存可服务多个学生。作者给出的适用设定包括LIBERO与RoboCasa-GR1仿真,以及AgileX Nero单臂与TRIP-Bag双臂真实平台上的抓放与交接任务;部署侧收益被明确限定为“继承表征、不承担生成开销”,即延迟与显存与未蒸馏基线相同。
作者自述增益“modest but consistent”,且在LIBERO与RoboCasa-GR1上仍落后于若干更大规模或依赖大规模数据工程的强基线,因此该表征先验在更强基线上的增量空间仍是开放问题。评估方面,作者指出两个仿真基准都非确定性:策略从流匹配头采样动作,渲染器在不同GPU上并非逐位一致,同一检查点换GPU可移动数个点,RoboCasa-GR1的消融因算力有限只在A100上评一次,对齐层扫描只跑四分之一训练预算,这些都会影响对小幅差异的解读。真实机器人失败模式被描述为放置误差与鸡蛋抓取滑落,作者认为这恰是表征先验最难帮助的部分,说明该方法的收益边界与接触级控制的关系仍待厘清。此外,教师缓存约需四张GPU一小时(LIBERO),教师特征读取层与池化方式的选择对结果的影响在本文中未做进一步扫描。
