DroneWAM 用 JEPA 潜空间预测与自适应 rollout 把无人机视觉导航的推理延迟降到 483 毫秒,并让闭环进度从 0.510 升到 0.774
核心概要
该工作提出 DroneWAM,一种面向无人机视觉导航的高效世界-动作模型:它用 JEPA 式架构在表示空间直接预测未来状态、用预训练 Resampler 把稠密编码器特征压缩为更少潜 token、并用偏好训练得到的 Gate 按场景自适应分配预测深度,同时构建了含同步 RGB 观测、6-DoF 飞行轨迹、控制指令与随机风扰的仿真数据集 DroneNav-6D;在 DroneNav-6D 上取得所比较方法中最好的轨迹精度,自适应 rollout 把平均预测深度从 8 降到 4.58 并同时提升轨迹精度。
深度剖析
DroneWAM 把未来预测放在表示空间而非生成未来图像,并用预训练 Resampler 压缩视觉 token,从而同时降低空间与时间上的预测开销。 相对显式预测未来视觉世界的空中世界模型与 WAM,以及只隐式建模未来视觉后果的视觉语言导航方法,这里把效率直接做进预测过程本身。 组件消融显示,加入 Planner 后 Rel.ATE 从 0.6621 降到 0.0584;再加入 Resampler 把推理时间从 656.12 ms 降到 582.65 ms 而轨迹误差几乎不变;token 数从 512 压到 128 时延迟从 591.28 ms 降到 483.29 ms,Rel.ATE 仅从 0.0574 变为 0.0578。
自适应 rollout 用偏好训练的 Gate 按当前场景决定预测深度,在降低计算量的同时提升轨迹精度。 既有模型通常使用预定义的 rollout 深度,对不同场景分配相近的预测计算;这里把预测深度变成可变长度 rollout 的停止决策。 平均 rollout 从 8.0 降到 4.578,Rel.ATE 与 Rel.RPE 反而优于固定深度;随机停止在几乎相同的平均深度 4.581 下明显更差,说明收益来自计算分配而非单纯截断;逐样本分析显示最优深度因样本而异。
DroneNav-6D 提供了超出常规 4-DoF 抽象的 6-DoF 空中运动监督。 多数既有空中视觉导航基准用平移加偏航的 4-DoF 表示飞行,对滚转与俯仰覆盖有限,而这两者直接影响相机视角与视觉动态。 数据集含 3,837 段轨迹、1,592,170 帧 RGB 观测、63.03 小时飞行、2,004.11 km 航程,训练与验证分别为 3,453 与 384 段,五个仿真世界在两侧均有覆盖,并注入随机风扰。
自适应 rollout 的收益不限于空中导航,在 LIBERO 机器人操作上也成立。 把同一 rollout 策略迁移到另一类具身任务分布,检验其是否为空中场景特有。 LIBERO 上延迟从 890.8 ms 降到 411.9 ms(降 53.8%),归一化 RMSE 从 0.2685 降到 0.2652,夹爪准确率从 89.83% 升到 90.55%,四个 suite 上均优于固定深度。
启示与展望
该结果面向机载算力受限的无人机视觉导航,尤其是图像目标条件下的闭环飞行;作者指出在中等复杂度的简单路线上 DroneWAM 达到 88% 成功率,比 NWM 与 FastWAM 分别高 14 与 16 个百分点,任务进度 0.95,延迟 460 ms。自适应 rollout 的适用面被进一步扩展到机器人操作,说明按输入分配预测计算这一思路可迁移到其他具身任务分布。数据集 DroneNav-6D 面向需要 6-DoF 运动监督的训练与评测,作者表示代码与数据将会发布。
作者在局限性中说明,固定 token 预算与有界想象视野可能需要随场景和算力预算调整,性能也依赖预训练编码器与 Resampler 保留的信息;在复杂场景的仿真闭环中任务成功率仍然很低,当前系统尚不适合真实部署。逐样本案例显示 Gate 偶尔过早停止,从而错过更深 rollout 带来的更低误差。困难闭环路线下所有被比较方法都未完成一个 episode,因此这些增益更适合被读作方向性证据而非已确立的结论。此外,本次可读文本为完整论文正文与附录,但表格以文本形式呈现,个别数值的排版细节需以原文为准。
