arXiv 2026年10月5日作者主张腿足机器人强化学习流水线中的奖励、课程门、评估统计与参考动作四层都是同一形式意义上的代理指标,各自有特征性偏离机制并可通过改写闭合;他用一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代的测量加以说明,其中基于平均误差的课程门在每次检查时都按速率上限推进而其所门控的技能并不存在,批量推力测试因同步重置与步态相位混叠,把0.5 m/s推力评为比2.0 m/s更危险。作者主张腿足机器人强化学习流水线中的奖励、课程门、评估统计与参考动作四层都是同一形式意义上的代理指标,各自有特征性偏离机制并可通过改写闭合;他用一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代的测量加以说明,其中基于平均误差的课程门在每次检查时都按速率上限推进而其所门控的技能并不存在,批量推力测试因同步重置与步态相位混叠,把0.5 m/s推力评为比2.0 m/s更危险。作者把四层人形机器人学习流水线都视为代理指标,指出课程门在技能缺失时仍按速率上限推进,且同步重置的推力测试把0.5 m/s推力排得比2.0 m/s更危险作者主张腿足机器人强化学习流水线中的奖励、课程门、评估统计与参考动作四层都是同一形式意义上的代理指标,各自有特征性偏离机制并可通过改写闭合;他用一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代的测量加以说明,其中基于平均误差的课程门在每次检查时都按速率上限推进而其所门控的技能并不存在,批量推力测试因同步重置与步态相位混叠,把0.5 m/s推力评为比2.0 m/s更危险。作者主张腿足机器人强化学习流水线中的奖励、课程门、评估统计与参考动作四层都是同一形式意义上的代理指标,各自有特征性偏离机制并可通过改写闭合;他用一个1.91米仿真人形机器人上单一PPO策略谱系、四个阶段共13500次迭代的测量加以说明,其中基于平均误差的课程门在每次检查时都按速率上限推进而其所门控的技能并不存在,批量推力测试因同步重置与步态相位混叠,把0.5 m/s推力评为比2.0 m/s更危险。