作者把四层人形机器人学习流水线都视为代理指标,指出课程门在技能缺失时仍按速率上限推进,且同步重置的推力测试把0.5 m/s推力排得比2.0 m/s更危险
相关研究与后续进展核心概要
作者主张腿足机器人强化学习流水线中的奖励、课程门、评估统计与参考动作四层都是同一形式意义上的代理指标,各自有特征性偏离机制并可通过改写闭合;他用一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代的测量加以说明,其中基于平均误差的课程门在每次检查时都按速率上限推进而其所门控的技能并不存在,批量推力测试因同步重置与步态相位混叠,把0.5 m/s推力评为比2.0 m/s更危险。
Fig. 1: A curriculum gated on averaged tracking error. Top: the reference amplitude advanced at its rate limit at every check. Bottom: the gated statistic stayed far below its 0.25 rad threshold, although the principal joint’s peak error was ≈ \approx 1 rad.
arXiv深度剖析
论文把奖励、课程门、评估统计和参考动作统一视为同一形式意义上的代理指标,认为规范失效不只发生在奖励层。 传统观点只把奖励当作被优化的代理,把奖励黑客问题定位在奖励本身;该工作把代理偏离扩展到课程门、评估统计与参考动作三层。 论证以形式化推导为主,并用一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代的测量作为示例。
每一层都有特征性偏离机制,并各自存在可闭合该偏离的改写方案。 论文为每层给出传统表述、偏离条件与替代方案,包括在二次核平坦处使用一阶L1代价、在课程门取平均处改用峰值与结果统计、门可达性与信息检查、确定性与相位去同步评估、把课程状态纳入模型、可行性优先的参考设计加残差前馈,以及保持函数性的输入加宽让同一策略继续生长而非重训。 替代方案以推导形式给出,并由同一策略谱系的测量示例加以说明。
课程门基于平均误差时,会在其所门控技能缺失的情况下仍按速率上限推进。 这给出课程门作为代理指标发生偏离的具体可观测形态,而不仅是理论上的可能性。 来自该1.91米仿真人形机器人PPO策略谱系在四个阶段、13500次迭代中的测量,论文报告该门在每次检查时都按速率上限推进。
批量推力测试中同步重置会与步态相位混叠,导致0.5 m/s推力被评为比2.0 m/s更危险。 这显示评估统计作为代理指标可以产生方向性错误的排序,而不仅是数值偏差。 来自同一策略谱系的批量推力测试测量,论文报告了该排序反转。
启示与展望
该工作面向组装腿足机器人强化学习流水线的研究者与工程师,适用于分阶段训练与评估的设置,尤其是奖励、课程门、评估统计与参考动作分别承担代理角色的流水线。它给出的改写方案按层组织,便于在既有流水线中逐层替换:在二次核平坦处改用一阶L1代价,在课程门取平均处改用峰值与结果统计,加入门可达性与信息检查,采用确定性与相位去同步评估,把课程状态纳入模型,采用可行性优先的参考设计加残差前馈,以及用保持函数性的输入加宽让同一策略继续生长。测量示例来自一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代,运行在单台笔记本GPU上。
读者仍需留意:所报告的测量来自单一1.91米仿真人形机器人上的一条PPO策略谱系,四个阶段共13500次迭代,尚不清楚这些偏离机制在其他机器人形态、其他算法或真实硬件上的表现。课程门按速率上限推进而技能缺失、以及0.5 m/s推力被评为比2.0 m/s更危险这两项观察,其可复现条件与统计稳定性有待更多设置下的检验。此外,本次读取范围仅为摘要,未包含正文、图表与附录,因此各层偏离条件的完整推导、替代方案的具体实现细节与全部测量结果无法在此概述,这些属于需要打开原文核对的开放问题。
