把Go1建模为胞腔复形并用Hodge消息传递,在退化训练下对未见执行器退化取得最高回报
核心概要
作者把Unitree Go1表示为胞腔复形,用四个肢体级和一个躯干级rank-2胞腔显式编码多关节机械单元,并在节点、边、面上做Hodge消息传递;在退化训练下,节点-边-面Hodge actor在未见执行器退化上取得最高回报、更高存活率和更低速度跟踪误差。
Figure 1 : Go1 higher-order morphology. (a) The twelve actuated joints form the 0-cells; sixteen 1-cells give eight serial couplings, four around the hip ring, and four dashed virtual closures that let each leg bound a face. The five shaded 2-cells are one per limb plus the body cell spanned by the four coplanar hips. (b) The same cells at the true Go1 joint positions, with distant limbs faded. Only the node-edge-face actor propagates through rank-2 cells. The legend maps each mark to its rank: a ring is a 0-cell, a solid line a 1-cell, a dashed line a virtual 1-cell, and a filled patch a 2-cell.
arXiv深度剖析
提出一种面向Unitree Go1的高阶形态表示:12个节点对应12个关节,16条边连接相邻关节与髋环,四个肢体环与一个躯干环被提升为5个rank-2面,从而把肢体和躯干这类多关节机械单元显式表示为高阶对象,而非仅由其边界边隐含。 既有形态感知策略多以经典图编码形态,关节为节点、连杆为边,只能表示包围这些结构的边,无法把结构本身作为高阶对象;本文用胞腔复形与固定关联矩阵把肢体级和躯干级结构显式化。 该表示由Go1的机械属性直接论证:每条腿的三个关节共同决定足端放置,失去一个关节的驱动需由其余关节补偿;四个髋关节刚性共面安装,构成与构型无关的髋环。表示规模在文中明确给出为12节点、16边、5面。
构建节点-边-面Hodge actor:每层传播把同秩消息(由Hodge Laplacian的下、上分量分别经共享边界的同秩胞腔和共享上边界胞腔耦合)与跨秩消息(经关联算子从相邻秩聚合)以可学习混合系数加权,再经可学习范数门与RMSNorm做残差更新;四层传播后对每个关节嵌入独立解码为tanh变换高斯分布,构成因子化策略。 高阶图学习此前多用于单纯复形或胞腔网络的一般信号处理;本文把rank-2胞腔用作四足机器人持久机械结构的载体,把高阶消息传递当作策略层面的形态先验,并在执行器退化下评估其效果。 所有actor变体共享同一critic、奖励、域随机化、优化设置与训练预算,每个策略训练400M环境步;critic使用MuJoCo Playground的标准特权观测critic,以隔离actor架构差异。
在容量匹配的健康/退化训练-评估研究中,退化训练下Hodge-F在未见复合执行器退化上取得最高回报22.40、存活率0.94和最低速度RMSE 0.252,优于MLP-C的19.98、0.88、0.324,也优于Hodge-L的18.61、0.83、0.325。 消融显示增益不能仅由逐关节因子化解释(MLP-D回报18.15、速度RMSE 0.320),也不能由常规图表示解释(GCN回报15.35、速度RMSE 0.339);面带来的优势相对Hodge-L主要出现在需要学习补偿的退化场景,而非名义运动。 退化机制为把两个执行器同时退化,共66个无序对,44对用于训练、22对留出;训练时每回合固定该对并采样为健康、弱或失效,评估在全部留出对与全部退化水平上取平均。
跨机制评估显示条件性:仅健康训练的策略在零样本退化评估中MLP-C回报16.89高于Hodge-F的15.59,说明形态感知结构本身不足以保证对未见执行器失效的鲁棒性;而退化训练的策略在名义评估中Hodge-F回报27.17、速度RMSE 0.220,超过MLP-C的24.85、0.306。 这表明退化训练使节点-边-面策略学到更广泛有效的运动策略,而非只专精于受损条件;同时把高阶形态先验的收益限定在训练分布包含退化的情形。 跨机制评估不重新训练,仅交换评估机制;健康机制下所有actor存活率均为1.00,退化机制下存活率差异明显。
启示与展望
该结果面向速度指令下的四足运动,适用于Unitree Go1在MuJoCo Playground Go1JoystickFlatTerrain任务中的仿真设置,退化形式为按比例缩放单个执行器最大可用扭矩,并在训练中一次退化两个执行器。对希望在不引入专用故障处理机制的前提下获得全身补偿能力的研究者,本文给出的可复用要素是:把肢体与躯干等多关节单元提升为rank-2胞腔的表示方式,以及节点-边-面Hodge actor的传播与解码结构。其收益的适用条件是训练分布包含执行器退化;仅健康训练时,形态感知结构本身并未带来对未见失效的鲁棒性。
读者仍需关注:本文结论建立在单一机器人平台与单一仿真任务之上,向其他形态、其他任务或真实硬件的适用性尚待检验;退化模型只考虑最大可用扭矩的缩放,未涵盖其他失效模式;跨机制评估显示收益依赖训练时是否见过退化,因此部署前需要确认目标退化分布是否落在训练覆盖范围内。原文以快速解析形式提供,图1与图3的具体内容未包含在文本中,因此胞腔复形的可视化与学习曲线的细节无法在此核对。
