BIRD 统一评测迭代奖励设计:简单设计选择最稳健,ERA-U/ERA-S 在匹配预算下排名前二
相关研究与后续进展核心概要
作者提出 BIRD,把 14 个已发表的迭代奖励设计(IRD)方法统一表示为同一循环的配置,在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 上以匹配的反馈条件与策略训练预算比较 6 个已发表方法并消融 30 个设计选择,发现多数设计选择(包括作者自己的提案)效果很小或不确定,而少数简单选择(如贪心保留检查点、摘要化反馈)稳定有效;据此从 RDA 出发做小规模爬山得到 ERA-U 与 ERA-S,二者在 Bradley–Terry 汇总排名中分列第一、第二,但小规模人类评分显示基准分数高并不等于行为自然。
Figure 1: Most iterative reward design (IRD) methods follow this basic loop. BIRD uses this shared structure to represent methods in a common format, making them easier to compare.
arXiv深度剖析
BIRD 把 IRD 方法表示为同一循环上的配置,共享设计选择的实现,从而在匹配反馈条件与策略训练预算下直接比较、消融和重组方法。 此前各方法的实现细节、反馈假设、模型骨干与策略训练流程不同,难以公平比较或隔离单个设计选择的效果;BIRD 用共享配置消除实现差异(如打破平局逻辑)作为混淆因素。 框架实现覆盖 14 个已发表方法,并对 MuJoCo、Meta-World MT10、Assistax、HumanoidBench 提供评测流程;作者称实现已对照原论文与参考源码核验,但部分论文未开源、部分骨干模型已弃用,完全保真困难。
在匹配条件下比较 6 个已发表方法,REvolve 整体最强(仅在 HumanoidBench 落后于 RDA),其余方法之间没有非重叠置信区间的稳定优劣;消融 30 个设计选择后,多数选择(含作者自己的提案)效果很小或不确定,少数简单选择稳定有效。 以往基准与消融多在单一算法和环境中测试设计选择,不清楚其能否迁移到其他算法、环境或组合;这里跨任务与算法栈系统评测,指出直觉驱动的设计选择常常无法迁移。 消融覆盖 9 个任务(6 个 MT10 任务与 3 个 Gym MuJoCo 任务),每个任务每个实验单元 5 个种子,效应以 Glass's Δ 表示并按任务汇总 95% BCa 区间;作者说明因穷举 BIRD 的 300 多个可配置选择在算力上不可行,30 个选择为人工挑选。
从 RDA 出发在四个未饱和的 MT10 任务上做小规模爬山,得到 ERA-U(无监督)与 ERA-S(有监督),二者在汇总 Bradley–Terry 排名中分列第一、第二,且排除开发任务后排名不变。 ERA-U 在 RDA 基础上加入五项选择(含峰值自奖励检查点、设计思路等),ERA-S 仅把排序信号从 VLM 完成度评分换成参考奖励、未做额外调参;作者强调二者不是要直接采用的最优方法,而是简单选择加小规模搜索即可大幅改进的证据。 ERA-S 超过最强有监督基线 REvolve,ERA-U 超过其无监督父方法 RDA,二者置信区间不重叠;ERA-U 从未接触基准信号,却排名高于除 REvolve 外的所有有监督方法;爬山仅用 24 个配置,多数配置在 24–30 次策略训练的缩减预算下运行。
小规模人类评分(两名作者、257 个片段、22 个任务)显示基准分数高并不等于行为自然:在 Assistax 与 HumanoidBench 上,所有被评方法(含 ERA-U、ERA-S)都未同时达到一致的成功与自然性,HumanoidBench 的 walk 与 crawl 参考奖励可在不像人那样行走或爬行的情况下被最大化。 以往工作多只报告基准分数;这里把完成度与自然性分开评分,并指出自然性评分与参考奖励的关联弱于完成度,且 VLM 评判在高分策略上偏差几乎翻倍。 67 个学习策略中有 9 个超过 75% 参考奖励,评分者判定这 9 个全部不自然;作者用两个脚本策略(背向跳跃、原地摇摆)达到相近参考奖励来排除纯属 RL 偶然发现怪策略的解释;HumanoidBench 的 73 条自然性评分中 70 条给 0 分且全部高置信。
启示与展望
BIRD 面向需要比较、消融或重组 LLM 辅助迭代奖励设计方法的研究者与工程师,适用于机器人控制类基准(MuJoCo、Meta-World MT10、Assistax、HumanoidBench)上、以匹配反馈条件与策略训练预算为前提的实验设置。它使研究者能在同一框架内复现已发表方法、单独改动某个设计选择、或把不同方法的选择组合起来,并据此原型化新组件;ERA-U 与 ERA-S 展示了从现有方法出发做小规模爬山即可获得排名靠前的配方,作者预期进一步搜索会显著超过它们。人类评分部分为初步对齐评估,用于提示基准分数之外还需考察行为自然性。
人类评分仅来自两名作者,可能不代表更广泛人群的偏好;评测只覆盖部分 IRD 方法,未包含 LIMEN、Auto-MC 等专门方法;未研究计算效率或降低 IRD 成本的方式;ERA-U 与 ERA-S 来自刻意小规模的搜索,并非追求最优性能;生成器与评判模型未系统变化,结论对模型选择的依赖未测,且公开基准存在任务信息泄漏进 VLM 的可能;评测仅限机器人控制。此外,VLM 评判在高分策略上偏差几乎翻倍,意味着无监督方法的排序信号随策略变好而变弱,可能限制其性能上限;自然性如何写入目标或反馈仍是开放问题。
