跳到主要内容
返回时间线
arXiv来源发表:

改写指令即可提升机器人成功率:从8个任务蒸馏出的改写规则让冻结VLA在12个留出任务上相对提升16%至27%

核心概要

该工作刻画了视觉-语言-动作模型(VLA)对指令措辞的敏感性:单词级编辑可使成功率相差数十个百分点,且仅靠措辞就能填补分布内与分布外任务之间21个百分点的差距;作者用大语言模型把少量训练任务的多种措辞评分蒸馏为10至20条改写规则,部署时对每条指令改写一次,在不改动策略权重的情况下使冻结模型在12个留出任务上相对提升16%至27%,并在LIBERO上把微调内成功率从93.6%提升到97.8%。

Source-provided article image: Rephrase Before You Act: Characterizing and Mitigating Language Sensitivity in Vision-Language-Action Models
Fig. 1 ·

Fig. 1 : Method overview. Evidence gathering : a VLM rephrases each training task, and the frozen VLA’s rollout success on each phrasing forms the evidence 𝒟 \mathcal{D} . Rule distillation : an LLM distills 𝒟 \mathcal{D} , once and offline, into 10–20 explicit phrasing rules R R . Rule application : at deployment a VLM conditioned on R R rewrites each incoming instruction once ( f R f_{R} ) before passing it to the unchanged VLA. The phrasings, scores, and rules shown are illustrative only.

arXiv

深度剖析

VLA对措辞的敏感性是系统性的,可用统计检验的单词级编辑摆动来刻画:例如“switch on the stove”成功率为100%,而“switch on the hot plate”仅2%;在SIMPLER任务上“purple eggplant goes on the sponge”为69%,去掉颜色形容词后降至8%。 此前工作(如LIBERO-PRO、LIBERO-Plus)指出指令扰动会造成14至50个百分点的损失,但多归因于模型忽略指令;本文给出更细粒度的观察——当策略确实关注语言时,单个词即可造成数十个百分点的摆动,并用统计检验筛选出显著摆动对。 在SIMPLER/Bridge上每个短语在24个固定场景布局上重复3次共72次评估,在LIBERO上每个短语在50个布局上评估一次;采用两比例z检验,并人工剔除可能源于场景歧义的集合(LIBERO上23个显著集合中剔除8个)。

仅靠措辞选择即可获得很大提升空间:oracle短语搜索显示,措辞本身几乎填补了分布内与分布外任务之间21个百分点的差距。 这量化了此前被视为“泛化差距”的部分实际上来自措辞,而非真正的任务新颖性;作者用三轮VLM生成加评分的迭代搜索选出最佳短语,并在留出布局上复测以确认选择未夸大提升空间。 SIMPLER上候选短语在布局0–17上筛选,随后在全部24个布局上每布局复测12次;留出布局18–23单独给出相同提升空间。LIBERO上候选在5–10个布局上筛选,oracle柱状图汇总各获胜短语在不相交布局上的复测结果。

把敏感性表达为显式改写规则可在不修改策略权重的前提下降低敏感性:从8个证据任务蒸馏出10至20条规则,部署时每条指令改写一次,冻结模型在12个留出任务上相对提升16%至27%,提升集中在分布外任务。 与测试时验证(如CoVer,每步从40个候选短语-动作对中选择)和逐任务指令优化不同,该方法只改措辞、不改动作,每回合只改写一次,因此每步推理成本不变,且零样本迁移到未参与证据收集的任务。 在12个密封Bridge任务、24个固定布局上评估,短语集包括72条对抗性、363条人类生成、186条VLM生成短语;采用配对符号翻转置换检验,效应在三个应用模型(Claude、Gemini、Qwen)和三次独立蒸馏下稳定,池化成功率波动为0.7至5.1个百分点。

该流程在LIBERO上复现:三个独立蒸馏的规则本把微调内成功率从93.6%平均提升到97.8%,而分布外成功率保持不变;无规则改写器在微调内无增益。 复现使用预注册的20个密封任务(10个微调内、10个微调外)、每任务10条VLM生成自然改写,证据仅来自非密封的单词级编辑对,说明规则本的效果不依赖特定基准或特定应用模型。 每臂在50个布局上评估;增益可归因于具体修复,如把hot plate/hotplate/burner改写为stove在约9条测试短语上提升45个百分点,把dish改写为plate提升24个百分点,把onto改为on、into改为in在约50条短语上提升2.5个百分点。

启示与展望

该结果面向在仿真中评估的冻结VLA:SIMPLER/Bridge的WidowX桌面任务与LIBERO桌面任务,成功由基准程序化判定。方法适用于已有可评分措辞证据、且希望在不重训练策略的前提下改善自然语言指令解析的部署场景;规则本一旦蒸馏完成即可离线复用,并零样本应用于未参与证据收集的任务与指令。作者指出,从更多任务蒸馏规则本可能带来更大增益,而真实机器人是自然的下一步。

规范指令集每个任务仅一条短语,作者明确说明其统计功效不足,应谨慎解读。微调内规则本表现较差,作者推测可能与较弱的代理评分有关,而LIBERO规则本因证据完全由rollout评分而未出现该问题。单词级编辑搜索未做多重比较校正,作者说明426个候选对中约21个显著摆动可能由偶然产生,并人工剔除了可能源于场景歧义的集合。评估仅在仿真中进行,真实机器人上的表现仍是开放问题;作者也把系统性地跨模型测量语言敏感性、并归因其成因列为最有价值的后续方向。

来源