ACT3三流Transformer让动作专家独占语义与动力学整合,RoboCasa成功率从59.4%升至71.2%
核心概要
作者提出ACT3,一种以动作为中心的三流Transformer:语义流(VLM)与动力学流(世界模型)各自独立前向计算,仅由动作专家通过逐层注意力读取两者的键值,并在动作监督下联合优化。在RoboCasa 24项厨房任务上成功率达71.2%(基线59.4%),LIBERO平均98.6%(基线96.9%),LIBERO-Plus分布偏移下82.4%(基线68.4%)。
Figure 2: Overview of the proposed ACT 3 . The architecture comprises three specialized transformer streams for semantic understanding, action generation, and dynamics prediction. The semantic and dynamics streams maintain independent forward computation, while the action expert attends to semantic, action, and dynamics representations at every action transformer block, making the action stream the sole integration point for control.
arXiv深度剖析
ACT3把动作流设为语义与动力学唯一的整合接口:每个动作层通过逐层注意力读取VLM与WM的键值,而两个上下文流互不读取对方表示,保持独立前向计算。 已有VLA用VLM主干但缺乏物理动力学先验,WAM用视频世界模型替换主干又可能损失任务级语义;现有多流方法多在动作通路之外引入语义-动力学耦合或动力学-动作耦合。ACT3取消了这些额外耦合,让动作专家成为语义与动力学首次汇合之处。 在RoboCasa 24项厨房任务上71.2%对59.4%(同一下游演示与相机视角);LIBERO四套件平均98.6%对96.9%;LIBERO-Plus同一10,030个扰动实例上82.4%对68.4%,且未额外微调。
跨流注意力拓扑的消融显示,允许动力学查询读取语义、再允许其读取动作、直至三流互相注意,成功率依次下降(64.6%、64.0%、59.1%),而ACT3的仅动作读取两上下文的拓扑最高(71.2%)。 该排序把“上下文构建阶段避免额外跨流依赖”与性能联系起来,说明独立构建的语义与动力学可由动作查询在动作表示演化中自行加权组合。 同一架构内的受控拓扑对比,所有变体都允许动作查询读取语义与动力学信息,差异仅在上下文如何构建;掩码施加于与语义、动作层交错的最后18个Cosmos块。
逐层访问优于末层复用:动作层读取对应VLM与WM层的键值时成功率71.2%,仅复用VLM末层、仅复用WM末层、两者都复用末层分别为65.8%、63.5%、64.6%。 说明中间层语义与动力学特征可能携带末层未暴露的细粒度运动线索,逐层交错让动作细化同时获得局部控制细节与任务级引导。 所有变体复用既有K/V投影,仅改变动作查询读取哪些上下文层,属受控对比。
生成式未来上下文与动力学预测监督各自独立提升控制:无预测监督时61.3%升至65.8%,有预测监督时66.0%升至71.2%;预测监督在仅用当前帧上下文时也带来提升。 把动力学流的两种作用(提供动作上下文、提供辅助预测目标)分离,并显示即使生成未来不进入动作流,学习演示转移仍能塑造控制相关表示。 四组因子配置共享同一Cosmos主干与动作上下文接口,上下文token预算不变;点估计显示两项收益近似可加。
启示与展望
该设计面向机器人操作:在RoboCasa 24项厨房任务、LIBERO四套件与LIBERO-Plus扰动实例,以及AgileX CobotMagic双臂平台的Bowl Stacking、Block Collection、Flower Arrangement三项真实任务上验证。方法可直接复用预训练VLA与Cosmos-Predict2.5-2B检查点,语义与动作流来自预训练基础模型、动力学流来自视频生成检查点,因此适合已有MoT式VLA与视频世界模型权重的团队。推理时每个策略查询采样一次未来隐变量并缓存逐层上下文,动作流以10步Euler积分生成动作块,上下文缓存随新观测刷新;作者指出未来工作将把这一以动作为中心的设计扩展到导航等其他具身任务。
真实任务每任务30次试验、每任务单独训练策略,样本规模有限;LIBERO-Plus上相机视角类别对两种策略都是最低分(47.1%对58.5%),观察几何变化仍是较难情形。推理延迟为LIBERO/RoboCasa上423/418 ms,对比基线161/160 ms,作者说明Cosmos Policy的610 ms与160 ms为已发表数据、非受控对比。注意力分析基于300次rollout、21,307次策略查询,事件前后变化以百分比点报告,作者以“可能解释”表述。特权自蒸馏两种设置(65.0%、63.3%)均未超过71.2%参考值,作者给出的是可能原因而非定论。未来目标时间偏移实验显示近邻连续目标最优(71.2%),较晚连续与近似均匀分别为65.4%与62.5%。
