BeyondCSe 让机器人凭“刚才用过的东西”抓取:遮挡目标成功率 77%,重遮挡下 95% 且平均视角从 3.35 降到 2.20
核心概要
该工作提出零样本机器人抓取系统 BeyondCSe,用现成的多模态大模型与点跟踪器从事件历史中恢复被指代目标的三维先验,并在目标被遮挡时结合当前场景几何主动选择视角,在单腕部 RGB-D 相机的真机实验中,初始可见与初始遮挡目标的抓取成功率分别为 76% 和 77%(最强基线为 40% 和 55%),在四个重遮挡场景中把成功率从 75% 提升到 95%,同时把平均视角数从 3.35 降到 2.20。
深度剖析
系统把“事件指代”这一指令类型变成可执行的抓取流程:指令通过目标在过去事件中扮演的角色(如“最先移动的物体”“花茎”“杯柄”)而非名称或外观来指定目标,视频推理先用 MLLM 生成目标外观描述与事件线索,再在初始图像中定位并抬升为三维动作点。 此前的语言引导抓取方法(LERF-TOGO、GraspSplats、Point2Act、GraspMolmo)主要在“当前场景”内按名称、类别、外观或部件解析目标,而由过去事件角色定义的目标无法仅凭当前场景识别;该工作把事件历史作为目标身份与空间证据的来源。 真机实验使用 ROBOTIS OMY-F3M 与腕部 Intel RealSense D435i,可见条件 10 个场景–查询对、遮挡条件 10 个场景各两个查询,每对 5 次试验,共 150 次;可见目标定位 43/50、遮挡目标定位 88/100,分别超出最强基线 32 与 20 个百分点。
当初始视角看不到目标时,系统用事件历史恢复目标的三维轨迹,并把它与当前场景几何融合成体素化的目标位置概率分布,再以“透射率感知”的可见性对候选视角打分,逐次观测后做贝叶斯更新。 既有主动感知方法从当前场景的几何信息增益、抓取可供性或物体–遮挡物关系推导视角分数;该工作改为使用目标自身的历史观测形成实例级先验,并对穿过未观测空间的视线按距离衰减置信度,而不是把该空间当作自由空间。 方法以 TSDF 建图、以事件轨迹的末段构造高斯先验并在可工作空间内归一化,混合权重保证历史估计不准时仍可恢复;消融显示去掉透射率衰减后平均视角升至 3.10(S3 需 5.2 个视角),去掉事件先验后成功率不变但平均视角从 2.20 升到 4.00。
在四个重遮挡场景中,系统在目标初始完全不可见(藏在篮子内或被其他物体挡住、固定鸟瞰视角也看不到)的条件下,取得 95% 抓取成功率与 2.20 个平均视角,优于被给予目标真值三维包围盒的主动感知基线(75%、3.35 个视角)。 该对比说明即使基线拥有目标真值框、消除了定位歧义,真值框本身既不揭示被遮挡的目标几何,也不保证抓取成功;而事件先验带来的空间引导能减少搜索视角。 四个场景 S1–S4 各方法使用相同场景与查询,所有方法在首个可行目标抓取处停止;消融变体保持候选视角、可行性检查、目标确认与抓取流程不变,仅改动信念权重、透射率或事件先验。
同一套流程无需针对数据集改提示词即可迁移到外部自我中心视频:在 EgoDex 与 EPIC-KITCHENS 的片段中,系统按盘子摆放或清洗的顺序选出被指代目标,并在末帧给出二维点。 这展示了方法超出自身采集装置的适用范围,同时作者也指出在包含大幅相机视角变化的 EPIC-KITCHENS 例子中,区域估计在末帧仍可能不精确。 属于定性示例,作者明确将其表述为“illustrate use beyond our capture setup”,并同时说明区域估计可能不精确。
启示与展望
该结果面向桌面场景中“人先与物体交互、机器人随后执行事件指代指令”的设定,硬件为单只腕部 RGB-D 相机,感知模型运行在单张 RTX 4090 工作站上;方法使用现成 MLLM 与点跟踪器,无需任务特定训练,因此可直接接入已有抓取生成与规划栈(如 AnyGrasp)。对希望构建家庭或实验室助手的读者,这意味着机器人可以在目标已离开初始视野时,仍依据“刚才用过的东西”这类指令完成抓取,并在重遮挡下用更少视角完成搜索。
系统假设目标在搜索期间保持静止,作者把“物体持续移动的交互”列为未来工作;外部自我中心视频上的验证是定性的,作者也指出末帧区域估计可能不精确。此外,本次读取的是论文正文与摘要,图 3、图 5、图 6、图 7、图 8 的具体图像内容未在文本中展开,因此逐场景的视觉细节与失败模式仍需回到原文图表确认。
