跳到主要内容
返回时间线
arXiv来源发表:

Vela 将机器人动作预测从固定步长动作块改为连续样条轨迹,在 LIBERO-X 平均成功率 45.3%、EBench 总体 49.7%,真实双臂煎蛋任务子任务平均成功率 67.5%

相关研究与后续进展

核心概要

Vela 是一个在轨迹空间预训练的视觉-语言-动作基础模型,用固定数量的三次 B 样条控制点加一个随运动自适应的时间跨度来表示未来动作,在约两万小时公开加约两万小时私有机器人数据上预训练后,于 LIBERO-X 取得 45.3% 平均成功率、EBench 取得 49.7% 总体成功率与 66 分任务进度分,并在轮式双臂机器人煎蛋任务上取得 67.5% 子任务平均成功率。

Source-provided article image: Vela: Scaling Vision-Language-Action Models with Adaptive Action Curve Parametrization
Figure 1 ·

Figure 1: Overview of Vela. At inference, Vela jointly predicts a fixed set of spline control points and a motion-dependent horizon, defining a continuous action trajectory that can be sampled at arbitrary control rates. During training, motion-dependent horizon adaptation constructs supervision targets that adequately represent the demonstrated motion. The same control point budget thus covers longer spans for smooth motion and shorter spans when finer temporal resolution is needed.

arXiv

深度剖析

把未来动作表示为连续轨迹而非固定时间网格上的动作块,可以在同一输出预算下同时覆盖长时程与局部精细动作。 以往基于样条的策略多用于任务专用策略、单一平台或下游动作分词与执行,本文把轨迹空间动作建模做成基础模型规模的预训练输出空间,并配以跨本体共享动作接口。 在 LIBERO-X 上平均成功率 45.3%,高于逐点基线 39.3%;在 EBench 上总体成功率 49.7%、进度分 66,均高于逐点基线 41.4% 与 54;消融显示仅事后样条拟合(38.9% 与 40.0%)无法复现该增益。

运动相关的时间跨度自适应让固定控制点预算按运动复杂度分配时间分辨率:平滑运动用更长跨度,快速局部变化用更短跨度。 已有样条策略通常在全局固定时间跨度上预测,对所有运动施加同一种时间一致性与局部表达力的折中;本文改为在噪声感知准则下为每条示范运动选择仍能充分表示的最长跨度。 在相同样条表示与控制点预算下,固定跨度版本平均成功率 43.2%,自适应跨度版本 45.3%,且五个扰动等级上均提升。

解码轨迹流匹配(DT-FM)按控制点误差对解码轨迹的影响加权,比控制点空间各向同性监督更贴合轨迹几何。 CP-FM 在参数空间用欧氏距离监督同一流残差,DT-FM 则先经样条解码再度量,等价于用解码器诱导的二次型替换各向同性权重。 CP-FM 平均成功率 44.0%,CP-FM 与 DT-FM 等权组合 44.9%,DT-FM 单独 45.3%;作者指出三者差异不大,说明有效轨迹空间学习不依赖特定损失组合。

轨迹空间建模可迁移到真实物理操作,在多阶段双臂协调、工具使用与持续接触任务上保持有效。 多数样条策略研究停留在仿真或单一平台,本文在轮式双臂机器人上给出煎蛋与削土豆两项长时程任务的物理证据。 煎蛋任务四个子任务各评测 10 次,Vela 子任务平均成功率 67.5%,逐点基线 37.5%,OpenWAM 40.0%;削土豆任务中 Vela 在每个阶段均不低于两个基线。

启示与展望

该结果面向以模仿学习为主、具备多本体示范数据的机器人操作场景:预训练使用约两万小时公开数据(60 个数据集、11 类本体)加约两万小时私有数据,模型规模为 3B PaliGemma 视觉语言骨干加 300M 流匹配动作专家,未引入额外可训练参数。方法适用于需要长时程覆盖与接触丰富精细操作的任务,例如桌面精密装配、移动抓放与多阶段双臂烹饪;部署时策略直接从当前上下文预测控制点与时间跨度,不做拟合或跨度搜索,因此推理开销与逐点基线相当。对希望复用该表示的团队,可直接采用其共享动作接口与噪声校准的目标构造流程,把已有动作块数据转换为样条监督目标。

读者仍需关注几点:其一,时间跨度自适应的收益在五个扰动等级上均存在但幅度有限(固定跨度 43.2% 对自适应 45.3%),其在不同数据规模与本体上的稳定性尚待更大范围验证;其二,三种几何监督目标的平均成功率差异较小(44.0%、44.9%、45.3%),损失设计的作用更像细化而非前提;其三,真实世界结论来自每子任务 10 次试验的两项任务,统计粒度有限;其四,当前策略只自适应时间跨度而固定控制点数量,同时变化两者需要变长预测与相应训练目标,是作者指出的开放方向;其五,本文模型规模与逐点基线相同,轨迹空间建模在更大骨干与更多数据下的表现仍待刻画。

来源