arXiv 2026年10月6日作者提出 BIRD,把 14 个已发表的迭代奖励设计(IRD)方法统一表示为同一循环的配置,在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 上以匹配的反馈条件与策略训练预算比较 6 个已发表方法并消融 30 个设计选择,发现多数设计选择(包括作者自己的提案)效果很小或不确定,而少数简单选择(如贪心保留检查点、摘要化反馈)稳定有效;据此从 RDA 出发做小规模爬山得到 ERA-U 与 ERA-S,二者在 Bradley–Terry 汇总排名中分列第一、第二,但小规模人类评分显示基准分数高并不等于行为自然。作者提出 BIRD,把 14 个已发表的迭代奖励设计(IRD)方法统一表示为同一循环的配置,在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 上以匹配的反馈条件与策略训练预算比较 6 个已发表方法并消融 30 个设计选择,发现多数设计选择(包括作者自己的提案)效果很小或不确定,而少数简单选择(如贪心保留检查点、摘要化反馈)稳定有效;据此从 RDA 出发做小规模爬山得到 ERA-U 与 ERA-S,二者在 Bradley–Terry 汇总排名中分列第一、第二,但小规模人类评分显示基准分数高并不等于行为自然。BIRD 统一评测迭代奖励设计:简单设计选择最稳健,ERA-U/ERA-S 在匹配预算下排名前二作者提出 BIRD,把 14 个已发表的迭代奖励设计(IRD)方法统一表示为同一循环的配置,在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 上以匹配的反馈条件与策略训练预算比较 6 个已发表方法并消融 30 个设计选择,发现多数设计选择(包括作者自己的提案)效果很小或不确定,而少数简单选择(如贪心保留检查点、摘要化反馈)稳定有效;据此从 RDA 出发做小规模爬山得到 ERA-U 与 ERA-S,二者在 Bradley–Terry 汇总排名中分列第一、第二,但小规模人类评分显示基准分数高并不等于行为自然。作者提出 BIRD,把 14 个已发表的迭代奖励设计(IRD)方法统一表示为同一循环的配置,在 MuJoCo、Meta-World、Assistax 和 HumanoidBench 上以匹配的反馈条件与策略训练预算比较 6 个已发表方法并消融 30 个设计选择,发现多数设计选择(包括作者自己的提案)效果很小或不确定,而少数简单选择(如贪心保留检查点、摘要化反馈)稳定有效;据此从 RDA 出发做小规模爬山得到 ERA-U 与 ERA-S,二者在 Bradley–Terry 汇总排名中分列第一、第二,但小规模人类评分显示基准分数高并不等于行为自然。