跳到主要内容
返回时间线
arXiv来源发表:

Tactile-JEPA 用触觉传感器拓扑图做掩码预训练,把力估计误差降低 6.3%、手内姿态误差降低 20.8%

核心概要

该工作提出 Tactile-JEPA,一种面向分布式触觉传感器(电子皮肤)的自监督预训练方法,它在触觉单元(taxel)连通图上按局部与全局两种尺度采样掩码,预测被遮挡 taxel 的嵌入表示,在磁性与压阻两类传感器、三种数据集(Sparsh-skin、Tactile socks、DECO-50)上,相比此前最强基线把力估计 RMSE 降低 6.3%、手内姿态估计 RMSE 降低 20.8%,并在动作分类、物体分类与触觉条件策略学习上取得一致增益。

AI-generated editorial illustration: Tactile-JEPA: Topology-Aware Self-Supervised Representation Learning for Distributed Tactile Sensors

深度剖析

Tactile-JEPA 把自监督掩码预测从视觉像素网格搬到触觉单元的连通图上,用局部掩码(Dijkstra 扩张得到的连通子图)捕捉局部接触细节,用全局掩码(全图均匀采样)反映整只手的接触状态,二者等量混合。 此前的分布式触觉表示方法要么把信号重排成图像沿用视觉自监督(如 T-DEX 用 BYOL),要么只把 taxel 位置当作逐单元特征(Sparsh-skin、STAT),要么依赖仿真中才能获得的接触面几何(HyperTaxel);该工作首次让传感器拓扑直接进入自监督掩码采样,且不需要坐标、标签或仿真特权信息。 消融实验显示,同为紧凑连通掩码、预算相同,仅在 taxel 图上采样(4L)就优于图无关的 I-JEPA 块状掩码(4I-JEPA),在力估计与策略学习两项上均更好;默认的 2L+2G 混合在力估计 RMSE 与手内姿态精度上取得最佳,在 DECO-50 上仅次于纯全局掩码 4G。

在冻结预训练编码器、只训练轻量任务头的评测协议下,Tactile-JEPA 在多个下游任务上超过 BYOL、MAE、DINO 与端到端基线。 相比各指标上的最强基线,力估计 RMSE 降低 6.3%、手内姿态 RMSE 降低 20.8%;在 Tactile socks 上动作分类准确率提升 1.28%、全身姿态 RMSE 降低 2.6%;在 DECO-50 的视觉-触觉策略学习上取得次优结果(MAE 最低),且无需针对数据集调参。 三个数据集覆盖磁性(Xela uSkin)与压阻(针织织物、Inspire FTP)两类传感器、单臂与双臂、人手与机器人手;每个自监督方法预训练三个随机种子、每个编码器训练三到四个任务头,共 9 或 12 次运行,报告均值与样本标准差,并对前两名做单侧 Welch t 检验。

该方法在异构触觉信号上训练稳定,而若干对比方法在部分数据集上崩溃。 BYOL 在 Tactile socks 与 DECO-50 上崩溃,MAE 在 Tactile socks 上崩溃,DINO 在 DECO-50 的标准配置下崩溃、需关闭 iBOT 损失才可用;Tactile-JEPA 用同一套掩码配置在所有数据集上稳定预训练。 表 II 与表 III 中相应单元格标注为 collapsed;作者同时报告 Tactile-JEPA 的预训练比 DINO 快 65–75%,并给出各数据集的 GPU 小时数(如 Sparsh-skin 6.1 小时、DECO-50 5.5 小时,四张 A100 80GB)。

掩码尺度会调节表示偏向:局部掩码利于精细接触任务,全局掩码利于整体接触状态相关的任务,混合尺度是通用预训练的稳健选择。 在 DECO-50 上纯全局掩码 4G 取得最低策略误差,与动作预测依赖整手接触状态一致;默认 2L+2G 在力估计与手内姿态精度上最好。把默认的全局上下文掩码换成局部上下文,会改善力估计但明显损害姿态与策略表现。 结论来自表 IV 的掩码策略消融,比较了 4I-JEPA、4L、4G、2L+2G 以及局部上下文变体(4L†、4G†、2L+2G†),并说明局部上下文变体被排除在最优与次优标注之外。

启示与展望

该结果面向覆盖机器人手或人体表面的分布式触觉传感器(磁性电子皮肤、压阻织物等),预训练只需传感器自身信号与已知布局,不需要 taxel 坐标、任务标签或仿真特权信息;编码器在下游保持冻结,只训练轻量任务头,因此适合标签有限、需要快速适配新任务的机器人学习场景。方法在短时间窗内定义预训练目标,不建模跨窗时间结构,把时序推理留给下游解码器,因而适合以控制回路频率调用编码器、再组合连续嵌入的部署方式。对 DECO-50 这类 taxel 数量很大的硬件,作者通过分组相邻 taxel 把序列长度降到可计算规模,说明该路线可扩展到高覆盖皮肤。

预训练目标只在短窗口内定义,跨窗口的时间推理交由下游解码器,因此长时程接触动态如何被表示仍是开放问题。评测集中在三个公开数据集与相应任务上,其他传感原理、其他本体与真实部署中的长期稳定性尚待观察。DECO-50 上 MAE 取得最低策略误差,说明不同自监督目标在不同任务上各有优势,何种目标组合最通用仍值得进一步比较。此外,本次读取的是论文全文文本,表格中的数值以文本形式呈现,个别单元格的排版细节(如显著性标注)在纯文本中不易完全还原,若需精确复现具体数字建议对照原文表格。

来源