跳到主要内容
返回时间线
arXiv来源发表:

SEER 用技能演化的图像接地推理,把自由文本提示下的 3D 医学分割最差 Dice 从 79.34 提升到 95.47,并把标准差压到 0.98

核心概要

该工作提出 SEER 框架,通过构建带技能标签的图像接地推理轨迹数据集 SEER-Trace(22,330 条多模态指令实例、1,811 例)、在推理时先提取解剖证据再生成可执行任务规范、并用 SEER-Loop 把高奖励推理轨迹蒸馏为可复用技能存入 SEER-Bank,从而在自由文本提示的 3D 医学图像分割中提升准确率与稳定性,报告称在语言扰动下性能方差降低 81.94%、最差 Dice 提升 18.60%。

Source-provided article image: Skill-Evolving Grounded Reasoning for Free-Text Promptable 3D Medical Image Segmentation
Fig. 1

Fig. 1. Illustration of the proposed SEER framework. SEER makes free-text prompt- able 3D medical segmentation robust by grounding clinical language in image evidence and evolving reusable reasoning skills.

· 第 3 页

深度剖析

SEER 把自由文本临床请求先转成“证据—理由—可执行答案”的结构化推理链,再交给冻结的分割骨干执行,从而在体素解码前完成语义对齐。 以往方法主要靠更强的视觉—语言融合或更大词表来提升鲁棒性,而这里显式引入中间推理步骤,把模糊表述与图像解剖证据对齐。 论文给出该三元组的形式化定义与推理公式,并在 PENGWIN 消融中显示:微调后的 VLM 加接地推理把平均 Dice 从基线 92.26 提升到 95.92,标准差从 7.49 降到 3.84。

SEER-Loop 通过 SEER-Bank 把高奖励推理轨迹蒸馏为可复用技能,并做去重与剪枝,使推理能力随轮次自我改进。 相比静态推理模块,这里把技能当作可审计、可检索、可更新的记忆单元,并用边际奖励增益估计技能效用。 论文给出技能库更新与效用估计公式,并在 PENGWIN 消融中显示加入 SEER-Loop 后平均 Dice 达 97.39、最差 Dice 95.47、标准差 0.98。

在自由文本提示模式下,SEER 在部分域偏移与严格分布外数据集上都优于对比基线,并显著降低对措辞变化的敏感度。 论文报告多个先前方法在自由文本提示下 Dice 接近零,而 SEER 在 BrainMetShare 与 PENGWIN 上同时提升均值、最差情况并降低方差。 表 1 显示 PENGWIN 上 SEER 自由文本 Dice 97.39、最差 Dice 95.47、标准差 0.98,对比 VoxTell 的 92.26、79.34、7.49;BrainMetShare 上 SEER 为 53.83、51.44、1.67。

SEER 的前端推理能力可迁移到其他分割骨干,替换为 MedSAM3 后仍提升零样本泛化与最差情况表现。 这表明收益并非绑定于单一分割网络,而是来自前端接地推理与技能演化。 论文报告在严格分布外的 PENGWIN 上,接入 SEER 后 MedSAM3 平均 Dice 从 5.75(标准差 6.40)升至 19.97(标准差 13.30),最差分数从 3.67 升至 3.94。

启示与展望

该工作面向需要以自由文本描述分割目标的 3D 医学影像场景,适用于希望用临床自然语言而非固定标签驱动分割的研究者与系统开发者;其设计目标是在冻结分割骨干之前生成一个证据对齐、可执行的任务规范,因此可直接叠加到已有分割网络上。SEER-Trace 与技能库为可复现研究提供了监督格式与记忆机制,便于后续扩展技能分类与评估更多临床任务。

读者仍需关注:技能库在更长演化轮次与更大技能分类下的行为、在更多解剖目标与机构来源上的表现,以及论文提到的失败模式审计;此外,SEER-Trace 的请求由大模型在约束提示下生成并经 5% 专家抽检,其覆盖的临床风格与真实世界分布的差距仍是开放问题。论文也指出未来需探索体素级 VLM 编码器与更广临床任务。

来源