RATE 用风险感知触觉编码把 UniVTAC 八任务宏平均成功率提到 71.8%,并以 0.59% 参数更新在三个真机任务上同时提升成功率与接触安全成功率
相关研究与后续进展核心概要
作者提出风险感知触觉编码(RATE):用双侧触觉历史经两层 LSTM 聚合交互上下文,并以短时程未来接触变化预测与连续任务风险告警监督共同塑造风险感知表征,再通过零初始化残差适配器把它叠加到冻结的预训练 ACT 策略上,仅更新约 0.59% 参数;在 UniVTAC 八个仿真任务上取得 71.8% 宏平均成功率(重训的 ACT+UniVTAC 为 47.4%),在 USB 插入、拧瓶盖、插头插入三个真机任务上成功率分别为 75%、85%、60%,接触安全成功率分别为 93.33%、100%、83.33%。
Figure 1: RATE in contact-rich manipulation: corrective behavior and task performance. (a) Representative interaction sequence: when the interaction reaches critical contact, baseline methods may continue toward failure, whereas RATE enables a corrective response toward successful execution. (b) Success rates across all eight simulation tasks, comparing RATE with representative tactile and large-scale policy baselines. RATE achieves the best or jointly best performance on six of the eight tasks. (c) Success rates on three real-robot tasks, including USB insertion, bottle-cap screwing, and plug insertion, where RATE achieves the highest success rate on all three tasks.
arXiv深度剖析
RATE 学习的是任务条件化的风险感知触觉表征,而非仅描述接触外观或几何。 既有触觉表征的学习目标并未按任务风险组织信息,风险相关信号多用于事件预测、控制约束或策略优化;RATE 用历史条件预测保留交互演化上下文,并用连续告警监督把该上下文与任务风险关联。 消融显示共同任务触觉基座宏平均 44.0%,仅加连续告警为 57.5%,仅加上下文为 56.0%,二者合并的 Full RATE 为 71.8%。
风险感知表征以零初始化残差方式补充而非替换常规触觉特征,实现参数高效适配。 残差适配器末层零初始化使融合表征在适配起点精确复现原触觉 token,训练时冻结常规触觉编码器、RATE 编码器、视觉骨干与 ACT 骨干,仅更新约 0.59% 参数。 以连续告警配置为直接对照,引入上下文与残差后接触密集任务平均成功率由 49.3% 升至 72.0%,其中 Insert Hole 由 32% 升至 71%、Insert HDMI 由 18% 升至 42%。
在 UniVTAC 八任务上,RATE 以约 133.2M 参数取得最高宏平均成功率,并在三类任务上均保持领先。 相比同配置重训的 ACT+UniVTAC(47.4%),RATE 宏平均为 71.8%;四个接触密集任务上分别提升 38、48、27、41 个百分点,并超过最强大规模基线 StarVLA- 15.6 个百分点。 每个任务 100 次闭环 rollout,使用每任务 100 条演示;基线中部分为原文报告的已发表成功率,ACT+UniVTAC 另按相同演示与相机配置重训。
真机上任务完成度提升同时伴随更高的接触安全成功率。 在 USB 插入、拧瓶盖、插头插入上,RATE 成功率 75%、85%、60%,宏平均 73.3%;接触安全成功率 93.33%、100%、83.33%,宏平均 92.22%,均高于各任务最强对照方法。 每任务 50 条演示、20 次试验,同一初始条件;接触安全以执行全程最大估计触觉深度低于预设阈值为判据,该阈值评估前固定并对所有方法一致。
启示与展望
该工作面向接触密集的机器人操作,适用于具备双侧触觉传感、可采集任务演示、且能定义任务相关告警信号的场景;仿真侧对应 UniVTAC 八任务与 Franka Panda 加双 GelSight Mini 配置,真机侧对应 xArm 7 加双 Daimon 传感器并把原生测量转换为类 GelSight RGB 触觉图像。方法的价值在于让预训练策略以极小参数代价获得风险上下文:训练时使用未来观测与告警目标,部署时仅依赖当前及历史视觉、触觉与本体感受观测,因此适合已有触觉策略的轻量升级。
告警信号由各领域任务相关交互信号自动导出并归一化,其定义方式如何影响跨任务迁移仍值得关注;接触安全以最大估计触觉深度作为过度变形的代理指标,而非直接测量接触力;真机每任务 20 次试验的规模使任务间差异的估计精度有限;作者也指出,当交互各阶段接触量级差异较大时,通过特征差分建模的局部时序变化可能使细微但任务相关的触觉变化变得不易区分,并计划探索尺度自适应触觉编码。此外,部分基线成功率引自已发表结果,与内部重训配置并非完全同源。
