跳到主要内容
返回时间线
arXiv来源发表:

SLR 用指尖射线状态加奇偶池化视觉目标监督连续隐推理,在 EgoPoint-Ground 上把同骨干 SFT 的 mIoU 最高提升 21.1 个百分点

核心概要

该工作提出空间隐推理(SLR),把指向手势的几何线索与目标区域外观组织成有序的连续隐状态:一个由指尖位置和指向方向监督的空间射线状态,后接四个与目标区域特征对齐的视觉状态,视觉目标用奇偶池化按行列奇偶把 ROI 词元分成四组取均值;在 EgoPoint-Ground 上相对同骨干监督微调,mIoU 在 Qwen3.5-4B、Qwen2.5-VL-7B、Qwen3-VL-8B 上分别提升 2.8、17.5、21.1 个百分点,两个困难子集均有提升,YouRefIt 上 IoU 0.5 精度达 77.6%。

Source-provided article image: Spatial Latent Reasoning for Embodied Reference Understanding
Figure 1 ·

Figure 1: Comparison of reasoning approaches on an EgoPoint-Ground example ( Li et al., 2026c ) . (a) Tool-assisted reasoning crops and re-encodes image regions during text generation ( Zheng et al., 2025 ) . (b) LVR ( Li et al., 2026a ) supervises continuous states by reconstructing annotated region features. (c) SLR combines one spatial ray state with four states supervised by parity-pooled target features. Image crops and ray overlays illustrate the reasoning operations and supervision targets; generic latent boundary markers are omitted for clarity.

arXiv

深度剖析

SLR 把指向接地中的手势几何与目标外观拆成有序的连续隐状态序列:一个空间射线状态由指尖位置与指向方向监督,随后四个状态与目标区域特征对齐,全部状态在训练和推理时都由模型循环生成,辅助标注只进入损失。 此前的区域接地隐推理(如 LVR 用教师强制区域词元监督视觉特征重建、RIS 结合框与语义监督)并不直接监督手部几何;SLR 把“手如何指向所指对象”这一关系显式纳入中间监督,并按顺序分配几何与视觉证据。 方法部分给出射线状态的原点与方向定义、辅助读出头的 LayerNorm 加两层线性映射、SmoothL1 指尖回归与方向余弦距离的组合损失,以及无效手指几何只跳过空间辅助项的处理;消融显示空间状态与视觉监督联合时在标准集和 Hard-Similar 上取得最佳 mIoU。

奇偶池化把可变尺寸目标区域转成四个相位特定的特征目标:按全局行列奇偶把 ROI 内词元分成四组并各自取均值,四组相位索引锚定在全图网格上,ROI 变化时保持不变。 与四象限(连续区域)、随机分组(改变组成员)和 Max(改变聚合方式)相比,奇偶池化在固定四状态预算下标准集 mIoU 分别高出 3.6、2.9、1.8 个百分点,并在三个阈值上领先,说明优势并非来自更大的隐步预算。 附录给出结构性质:每个 ROI 词元只贡献一个描述子,空相位被省略而不复制词元,相位均值按计数加权可恢复整体 ROI 均值;同时说明相位平均是有损的,不重建特征网格,也不蕴含平移不变性。

在 EgoPoint-Ground 上,SLR 相对同骨干监督微调在全部九个骨干—评测组合上 mIoU 更高,标准集增益 2.8 至 21.1 个百分点;在 Qwen2.5-VL-7B 与 Qwen3-VL-8B 上标准集 mIoU 各超出最强已报告推理基线 4.3 个百分点。 增益同时出现在直接预测基线和显式推理基线之上,且在 Qwen3.5-4B 上 P@0.7 从 0.761 升到 0.811,说明提升包含满足更严格重叠判据的框。 结果按骨干分组以区分框架贡献与底层模型差异,人类表现单独作为参考;作者指出聚合 IoU 指标无法区分指代选择错误与框定位错误。

在 YouRefIt 上,SLR 相对同骨干零样本模型在 IoU 0.25/0.5/0.75 阈值上的增益相近(8.4/8.0/8.1 个百分点),IoU 0.5 精度为 77.6%。 增益在最严格阈值上仍然保持,支持该基准上精确定位的改善;作者说明该比较是训练后框架对预训练模型,并未分离任务特定 SFT 之外的贡献,文献分数保留各自原始协议。 该基准上 SLR 的 77.6% 精度相对所报告的最先进结果有 5.2 个百分点的数值差距,但评测协议不同。

启示与展望

该结果面向单图、二维的指向手势接地设定:输入为图像与语言查询,训练时可用手指基点与指尖标注以及目标框,推理时只生成五个循环状态并贪心解码框,不做射线—物体求交。对使用同类多模态骨干、且能提供手部关键点与目标框标注的团队,这套监督可直接复用;作者把深度与时序监督、更弱标注需求、场景自适应状态列为后续方向。方法建立在 LVR 的连续隐状态反馈之上,并沿用 Coconut 的通用边界标记。

读者仍需关注:聚合 IoU 无法区分指代选择错误与框定位错误;Hard-Complex 上 Target-only 反而领先完整模型(0.597 对 0.551),说明收益依赖场景条件;Qwen3-VL-8B Hard-Similar 上 Text CoT 的 mIoU 更高(0.353 对 0.315),对显式推理的优势随设定变化;注意力图只说明状态角色互补,不构成因果推理机制;作者也指出配置比较未分离特定几何机制的因果贡献,且需要重复运行与更广评测来评估稳健性。此外,报告的时间包含设备传输、哈希与评分等开销,并非纯解码延迟,隐状态数量与推理速度不能直接等同。

来源