跳到主要内容
返回时间线
arXiv来源发表:

HuRo把五个人类视频源转成约1.42亿帧机器人化数据,ALEX真机预训练把OOD完成度从34.9%推到72.2%

核心概要

HuRo提出一套把异构第一人称人类视频转成机器人对齐观测与动作轨迹的机器人化流水线,构建了来自EgoDex、EgoVerse、Ego4D、Ego10K和EPIC-Kitchens五个来源、约1.42亿帧的HuRo数据集,并在ALLEX双臂灵巧机器人上对VLA策略做预训练:随机器人化数据量增加,四个真机操作任务的平均完成度从无预训练的51.5%提升到全量预训练的80.3%,ID完成度从68.1%升到88.4%,OOD完成度从34.9%升到72.2%。

AI-generated editorial illustration: HuRo: Robotizing Human Videos for Scalable VLA Pretraining

深度剖析

论文构建了一条联合观测—动作的机器人化流水线:先做人类视频标注(相机内参、手部检测与MANO手姿、掩码DROID-SLAM相机轨迹加MoGe-2度量尺度与GeoCalib重力对齐、分块并用Qwen3.5生成语言指令),再做动作转换(用PyRoKi两阶段把人类手部运动重定向为机器人关节轨迹,并由状态轨迹导出动作标注),最后做视觉转换(SAM2分割手臂、ProPainter修补、Isaac Sim渲染机器人叠加)。 既有的人类到机器人工作多在任务匹配场景下演示,或把观测对齐与动作对齐分开处理;该流水线用可用标注并估计缺失信号,把标注水平不同的异构来源统一到同一机器人观测—动作格式。 方法在正文与附录中逐步给出各阶段所用组件与两阶段优化目标;附录F给出流水线耗时与质量诊断,例如相机轨迹相对EgoDex标注的中位旋转误差、中位位置ATE 4.47 mm,手姿根相对21关键点中位误差20.4 mm,重定向后指尖残差中位21.2 mm。

由此构建的HuRo数据集覆盖五个第一人称人类视频源,按帧数计EgoDex约55.5%、EgoVerse约26.5%、Ego4D约10.4%、Ego10K约6.0%、EPIC-Kitchens约1.7%,合计约1.42亿帧、约1316.8小时。 论文称其规模比此前机器人化视频预训练方法所用数据大一个数量级以上,并且是混合来源而非单一来源。 附录D给出各来源帧数、小时数与帧占比表;附录D.2用DINOv3特征对OpenImages参考集测视觉覆盖、用指令中的动词/物体/动词—物体对数量测指令覆盖,显示混合来源随子集增大而覆盖上升,且混合50%在相近采样量下覆盖高于EgoDex-only。

在ALLEX真机四个操作任务上,随机器人化人类视频预训练数据量增加,下游表现持续提升:平均完成度从无预训练的51.5%升到全量预训练的80.3%,ID从68.1%升到88.4%,OOD从34.9%升到72.2%;全量预训练模型在ID与OOD下均优于所报告的参考模型。 此前机器人化视频多用于视觉表征或辅助预测目标,本文把机器人化数据当作可扩展的联合观测—动作监督来源,并给出数据量—性能的缩放证据。 四个任务共使用43、40、16、20条演示,ID/OOD rollout数分别为12/12、12/24、12/12、无ID/10;Apple Pick-and-Place用二值成功,其余用分阶段部分完成分。预训练变体固定优化步数与全局批大小,仅改变数据量。

消融显示视觉机器人化与重定向动作监督各自有贡献:no-overlay变体ID与全量HuRo相当(89.4%对88.4%),但OOD明显更低(55.7%对72.2%),甚至低于无预训练的34.9%之上有限;在Diverse Pick-and-Place上,仅视觉迁移相对无预训练提升有限,而端到端带重定向动作的预训练在ID与OOD分别达到更高完成度。 论文把视觉转换与动作监督分开检验,说明二者并非可互相替代,且动作监督带来的收益超出纯视觉迁移。 no-overlay变体使用相同预训练数据与重定向动作监督,仅保留原始人类视频观测;动作监督对比包含No PT、PT(Visual Only,重初始化动作头)与PT(Visual + Action)三种设置,并在ID 36次、OOD 18次试验上评估。

启示与展望

该结果面向希望用人类视频扩充VLA预训练数据的机器人学习研究者与工程团队,适用场景是ALLEX这类双臂灵巧机器人上的桌面操作任务,以及附录中作为迁移目标的OpenArm。论文明确说明机器人化观测保真度受重建与视觉转换质量限制,当前叠加渲染未显式建模机器人与场景几何之间的遮挡;数据集提供视觉与运动学动作监督,但不包含力或触觉信号;运动学重定向不建模自碰撞或物理接触,五源审计中仅55.2%的轨迹在采样帧内未检测到非抓取自接触,因此这些轨迹被定位为预训练监督而非可直接执行的机器人演示。

正文中若干数值在加载文本里以占位形式出现(如数据集规模、完成度起止值、部分超参数),因此本总结中的具体数字主要取自附录表格;若需引用正文原始数值,应以论文原文为准。机器人化保真度与下游策略学习之间的关系论文称尚未系统刻画,不同保真度水平的影响仍是开放问题。自碰撞、接触力与触觉信号的缺失意味着接触密集任务上的表现仍需进一步观察。多embodiment数据带来的收益在附录中只做了初步对比,embodiment多样性、形态与动作接口如何影响机器人化数据效用,论文将其列为未来方向。

来源