SWiM 用工作记忆蒸馏让多模态大模型在无记忆推理时也能提升推理分割,并在基准上达到最优
核心概要
该工作发现多模态大模型在重新审视同一图像与查询时,其自生成的推理轨迹与定位提议可作为工作记忆提升推理分割,于是提出 SWiM 框架:按分割质量筛选 rollout 构建工作记忆,以记忆条件模型为教师,在学生自生成轨迹上提供 token 级分布监督,学生仅接收原始图像与查询,并联合优化 on-policy 自蒸馏与基于结果的强化学习,在推理分割基准上取得最优性能。
Figure 1: Working-memory-guided reasoning segmentation. Given an image and a query, the MLLM generates reasoning traces and localization proposals that form its working memory. It then revisits the same image and query with this memory as additional input, predicting boxes and points that prompt a frozen SAM2 model to produce the final mask.
arXiv深度剖析
作者观察到多模态大模型能够把自身先前生成的推理轨迹与定位提议当作工作记忆来使用,在重新审视同一图像与查询时获得更好的推理分割表现。 此前推理分割通常把 MLLM 的推理与定位输出视为一次性结果,而这里把同一模型的先前输出重新作为上下文输入,明确把“重访”这一自生成记忆机制作为可利用的信号。 该结论来自作者的探索性观察,摘要以“Our exploration reveals”表述,未给出具体数据集、样本量或对照设置。
提出 SWiM(Reasoning Segmenter with Working Memory)工作记忆蒸馏框架:按分割质量选择 rollout 构建工作记忆,把记忆条件模型作为教师,在学生的自生成轨迹上提供 token 级分布监督,而学生输入仅为原始图像与查询。 与仅依赖结果奖励或仅依赖教师轨迹模仿的做法不同,这里把“带记忆的自身”作为教师,使学生在推理时无需工作记忆也能继承重访带来的指导。 方法描述来自摘要,属于框架层面的说明;摘要未报告教师与学生规模、rollout 数量或筛选阈值等实现细节。
SWiM 联合优化 on-policy 自蒸馏与基于结果的强化学习,把工作记忆引导与对分割质量的直接反馈结合起来。 将分布级蒸馏信号与结果级奖励信号在同一训练流程中联合,使工作记忆的引导不只停留在模仿层面,也与最终分割质量挂钩。 摘要给出联合优化的组成,但未提供损失权重、训练步数或消融结果。
在推理分割基准上的大量实验显示 SWiM 达到 state-of-the-art 性能,验证了工作记忆蒸馏的有效性。 把“重访自生成记忆”的收益从推理期技巧转化为可训练、可在无记忆条件下部署的能力。 摘要以“Extensive experiments on reasoning segmentation benchmarks”和“state-of-the-art performance”概括,未列出具体基准名称、指标数值或对比基线。
启示与展望
该工作面向推理分割这一具体任务,适用于能够生成推理轨迹与定位提议、且可对分割质量打分以筛选 rollout 的多模态大模型训练场景。其目标是让骨干模型在推理时无论是否提供工作记忆都能受益,因此对希望在不增加推理期上下文开销的前提下提升分割质量的读者具有直接参考价值。摘要层面的信息适合用来判断方向与框架,若要复现或比较,需要进一步查看论文中的基准设置、教师与学生配置以及训练细节。
摘要未给出具体基准名称、评价指标数值、对比基线以及消融实验,因此“state-of-the-art”的具体幅度与各组件贡献尚不清楚。工作记忆的构建依赖按分割质量筛选 rollout,筛选标准与质量评估方式在摘要中未展开,可能影响方法在不同数据分布下的稳定性。教师为记忆条件模型、学生仅见原始图像与查询,二者能力差距与蒸馏信号强度之间的关系仍是值得关注的开放问题。此外,摘要未说明该方法在推理期完全不提供工作记忆与提供工作记忆两种设定下的表现差异。
