RoboFollow 用高熵场景诊断九类具身策略:L0 近乎满分,L1–L3 意图得分骤降,更强 VLM 与现有优化均未弥合差距
核心概要
该工作提出 RoboFollow 诊断基准,通过高场景熵设计、L0–L3 分层扰动协议与意图/执行分阶段评分,评估九个 VLA 与 WAM 策略,发现其在分布内 L0 表现强劲但在 L1–L3 下意图得分大幅下降,且更强 VLM 骨干、QA 协同训练、LangForce 与无分类器引导均未能弥合该差距。
深度剖析
RoboFollow 把“语言是否必要”变成可测量的数据集属性:同一初始场景配置支持多个运动学上可行且语义有效的任务分支,使仅凭视觉无法确定目标行为。 既有操作基准多以最终任务成功率为主,且许多回合存在可从初始视觉推断的主导行为,语言因此部分冗余;RoboFollow 以场景熵刻画训练任务标签在任务无关初始场景下的条件熵,并报告其取值高于同等任务标签定义下等权重的 LIBERO Spatial/Object/Goal/Long 套件。 论文给出场景熵的形式化定义与分组计算,四个场景共 3,750 条训练回合,每个任务 50 条演示;场景 1/2/3 各含一个 16 任务标签组,场景 4 含 16、7、4 三个组。
L0–L3 分层协议与意图/执行分阶段评分把语义误解与运动执行失败分开,结果显示失败主要来自语义意图选择而非低层控制。 传统二值最终状态成功率会惩罚意图正确但执行有偏差的策略,也会奖励通过语义错误中间动作达成最终状态的策略;RoboFollow 按阶段报告 Intent Score 与 Execution Score,并设置占 20% 的收尾阶段要求任务完成后停止无关动作。 在场景 1 与场景 2 上,部分模型 L0 意图得分接近饱和,例如报告 99.1% 与 100.0%,另一模型为 98.2% 与 95.6%;但场景 1 中一个模型从 L0 的 98.2% 降至 L1 的 0.0%,另一个从 99.1% 降至 L1 的 45.5%、L3 的 44.9%,场景 2 中一个模型从 L0 的 100.0% 降至 L3 的 34.2%。
对场景 2 的机制诊断显示两层瓶颈:VLM 骨干的场景理解本身不足,且即使理解正确,动作生成管线也未必忠实转化。 论文用 20 题视觉问答探针分别探测 VLM 场景理解与语义向动作生成的传递保真度,而非仅从端到端成功率反推原因。 基础 PaliGemma、预训练骨干与微调骨干的问答正确数分别为 1/20、2/20、3/20;对于微调 VLM 答对的题目,约一半回合仍产生错误操作行为;在 VLM 骨干全程冻结的 Motus 中也观察到类似的理解与执行脱节。
三类代表性缓解手段在测试配置下均未把泛化推过 L0:更强 VLM 骨干加 QA 协同训练、LangForce、以及无分类器引导。 论文把“换更强骨干”“在训练中保留语言能力”“在推理时放大语言条件”这三条常见路线放在同一高熵诊断下比较,并给出各自失效方式。 Qwen3-VL-4B 在场景 2 的细粒度问答探针上达到 19/20,但将其与 GR00T 扩散动作头结合并做 QA 协同训练后,L1–L3 的分布外指令跟随仍出现崩溃;LangForce 仅带来边际变化;CFG 在引导尺度 1.2 与 1.5 时甚至降低 L0 表现并产生不稳定轨迹。
启示与展望
该基准面向需要区分“语义选错”与“动作没做好”的具身策略研发与评测场景,适用于受控高熵仿真环境中的短时程操作,其设计原则是让语言成为必需而非可选。对使用者而言,它可用于在训练阶段引入任务歧义、在评测阶段用 L0–L3 分离视觉绑定、语义重组与联合泛化,并用意图/执行分阶段评分定位失败环节。论文也指出,其控制变量覆盖演示数量、指令变体与训练步数,但未测试训练期结构布局多样性的增加,因为那需要新的训练布局并保持评测布局留出。
论文明确将 RoboFollow 定位为诊断基准,其受控场景简化了物体几何、任务时程与交互动力学,因此不覆盖长时程规划、富接触操作、开放词汇多样性与大规模真实部署。真实机器人试点使用不同指令集与拾取/堆叠构成,而非匹配任务对,论文也说明尚未建立跨仿真器或向更复杂真实任务的迁移。微调控制显示增加演示数量、指令变体与训练步数可改善场景 2 的部分指标,但 L0–L2/L3 差距仍然显著,结构布局多样性尚未测试。此外,本次加载文本为完整正文,但表格中的逐模型数值以文字描述形式出现,若需精确到每个模型每个层级的分数,仍需查阅原文表格。
