跳到主要内容
返回时间线
arXiv来源发表:

TacEx 用触觉好奇心驱动机器人探索,无需任务奖励即可学会抓取并提升 VLA 下游表现

相关研究与后续进展

核心概要

该工作提出 TacEx 框架,将模型不确定性按感知模态分解并把好奇心导向触觉通道,使机器人在无任务奖励、无专家示范的探索中学会操作与抓取,所采集的交互密集数据集可支持离线学习下游取放策略,并可用于后训练视觉-语言-动作(VLA)模型,在初始未接触触觉反馈的 VLA 上显著提升下游性能且保持高样本效率。

Source-provided article image: Tactile Curiosity Drives Robot Interaction
Figure 1 ·

Figure 1: Overview of TacEx . The state s s concatenates the fused latent z z , a visual embedding v v , and a tactile embedding ι \iota , where v v and ι \iota are produced by separate CNN encoders from RGB and tactile force maps. At each step, the policy π ⁡ ( a | s ) \pi(a|s) acts in the environment, and the resulting transitions train an ensemble environment model that predicts the next state s ′ s^{\prime} . The model’s epistemic uncertainty decomposes per modality into σ n z \sigma_{n}^{z} , σ n v \sigma_{n}^{v} , and σ n ι \sigma_{n}^{\iota} ; unlike standard MaxInfoRL [ 31 ] , which rewards the agent for total predictive uncertainty, TacEx explicitly weights the tactile component σ n ι ​ ( s , a ) \sigma_{n}^{\iota}(s,a) in the exploration bonus. This anchors curiosity to the sense of touch, driving the agent toward contact-rich interactions and away from uncertainty in functionally irrelevant regions and transitions.

arXiv

深度剖析

提出 TacEx,把触觉反馈作为探索的自然信号,通过按感知模态分解模型不确定性,将基于认知不确定性的好奇心定向到触觉通道。 相对于基于模型分歧或认知不确定性的既有内在动机方法,TacEx 针对这些方法可能奖励功能上无关的转移(例如自由空间中的无规运动)这一问题,用模态分解把探索预算集中到接触相关转移上。 摘要层面给出的是框架设计与动机论证,说明其相对各向同性噪声与既有内在动机方法的改进方向;具体实现细节、对比基线与量化指标未在所提供的文本中给出。

在触觉驱动的好奇心引导下,机器人能够发现复杂的接触动力学,在探索阶段不使用任务奖励、也不使用专家示范的情况下学会操作与抓取物体。 把无奖励、无示范的探索能力从自由空间运动扩展到接触密集的操作与抓取行为,说明触觉通道可作为探索信号的来源。 属于作者在摘要中陈述的实验结果,未提供任务数量、成功率或样本量等具体数值。

通过触觉驱动好奇心采集的交互密集数据集,可支持下游取放(pick-and-place)策略的离线学习,且无需额外的环境交互。 把探索阶段产生的数据转化为可复用的离线学习资源,使下游策略学习不再依赖新的在线交互。 摘要陈述该数据集支持离线学习下游策略;未给出数据集规模、离线算法或性能对比数字。

将触觉驱动探索用于后训练视觉-语言-动作(VLA)模型:尽管 VLA 初始预训练时没有触觉反馈,用 TacEx 后训练后下游性能显著提升,同时保持很高的样本效率。 表明触觉探索可作为 VLA 的后训练手段,在预训练阶段缺失触觉模态的情况下补入接触信息。 摘要给出方向性结论(性能显著提升、样本效率高),但未提供具体提升幅度、基准任务或样本量。

启示与展望

该工作面向机器人操作与抓取场景,尤其是接触密集、任务奖励与专家示范难以获取的设定;其价值在于用触觉通道引导探索,并把探索阶段产生的交互密集数据用于下游取放策略的离线学习,以及用于后训练初始未含触觉反馈的 VLA 模型。适用对象是需要低成本采集接触数据、或希望在已有 VLA 上补入触觉能力的研究与工程团队。

所提供文本为摘要级内容,缺少图表与实验细节,因此无法判断触觉好奇心在何种任务分布、何种触觉硬件条件下成立,也无法比较其相对既有内在动机方法的具体增益幅度;VLA 后训练的性能提升幅度、样本效率的具体度量方式、以及离线数据集规模与下游策略的泛化范围,均需在正文中确认。此外,模态分解的不确定性估计在触觉信号噪声较大或接触稀疏时如何表现,属于值得关注的开放问题。

来源