医学与健康
461 条内容
OncoAgent 把食管癌放疗临床指南文本零样本转成三维靶区,CTV Dice 达 0.842,与全监督 nnU-Net 无显著差异
该研究提出 OncoAgent,一个由大语言模型驱动的指南感知 AI 智能体框架,把自由文本临床指南解析为工具调用计划并执行,从而在无需任何专家标注训练数据的情况下生成三维靶区;在 40 例中段胸段食管癌计划 CT(32 例训练、8 例测试)上,其零样本 CTV Dice 为 0.842、PTV Dice 为 0.880,与全监督 nnU-Net(GTV Prior)的 0.862 和 0.893 在主指标上无统计学显著差异,并在双盲医师评分中于指南依从性、修改工作量和临床可接受性三项均高于该监督基线。
IntraStyler 用对比学习风格编码器免预定义子域合成 T2 MRI 风格,在 CrossMoDA 上把 Extra-VS 的 Dice 从 0.61 提升到 0.81 且失败数降为 0
该工作提出 IntraStyler,一种无需任何预定义子域的 3D 非配对图像翻译方法,用对比学习训练的风格编码器从每张目标域图像提取与解剖解耦的风格嵌入,并通过动态实例归一化条件化 QS-Attn 合成网络;在 CrossMoDA 基准(226 例标注 ceT1、295 例无标注 T2、测试集 96 例 T2)上,它自动聚类出 7 个风格参考而非子域方法的 3 个,下游 nnU-Net 分割在 Intra-VS、Extra-VS、Cochlea 上取得最佳 Dice 与 ASSD,Extra-VS Dice 达 0.81、失败数为 0。
MedQ-Engine 用 10K 标注把 8B 医学图像质量评估模型提升到超过 GPT-4o 逾 13%,与人类专家差距缩至 4.34%
该工作提出 MedQ-Engine 闭环数据引擎,通过“评估—探索—进化”三阶段迭代:在开发集上把模型失败案例聚类为失败原型,用原型视觉分量在约百万张、覆盖五种模态的医学图像池中检索候选样本,配合熵引导路由的渐进式人在回路标注与质量保障微调,仅用 10K 标注即让 8B 参数模型在医学图像质量评估上超过 GPT-4o 逾 13%、与人类专家差距缩小到 4.34%,样本效率比随机采样高 4 倍以上。
将提示依赖拆成提示歧义与局部敏感度后,两个指标与妇科盆腔MRI分割质量显著负相关且彼此低相关
该工作提出首个把提示依赖显式拆分为提示歧义(用户间差异)与局部敏感度(交互不精确)的框架:用混合密度网络建模图像条件下的合理提示分布并以协方差迹量化歧义,用稳定裕度刻画在测量噪声下引发掩膜变化所需的最小扰动,并在UT-EndoMRI(81例子宫内膜异位症患者、子宫分割)与MOGaMBO(94例局部晚期宫颈癌患者、膀胱分割)两套女性盆腔T2加权MRI上评估MobileSAM与MedSAM,发现两个指标与Dice呈显著负相关、彼此相关性低,且条件采样得到的像素级不确定度图与分割错误区域对齐。
用强化学习微调的小模型让机器人超声按指南自主扫描胆囊、脊柱和肾脏
该工作提出一个由大语言模型智能体驱动的自主机器人超声框架:智能体从扫描手册中检索指南步骤,结合当前观测与扫描状态进行推理,动态调用轨迹规划、机器人执行、接触调整、语音引导和轨迹细化等工具,并用基于强化学习(PPO)的微调提升推理质量与工具选择及参数化的正确性;在10条未见过的超声扫描指南上做语言层面验证,微调后步骤级准确率由0.6512升至0.8973、整体成功率由0.5384升至0.9230,并在三名人类志愿者上完成胆囊、脊柱和肾脏的真实机器人扫描,脊柱与肾脏全部成功,胆囊有一例因需要屏气指令和患者配合而失败。
SEA-PEFT 在 1/5/10-shot 3D 医学分割中把平均 Dice 提高 2.4–2.8 分,且只训练不到 1% 参数
作者提出 SEA-PEFT,把适配器配置当作微调过程中的在线分配问题,用“搜索—审计—分配”循环训练当前激活的适配器、通过临时关闭某个适配器来估计其 Dice 效用、再在参数预算下用贪心背包重新选择激活集合,并以 EMA+IQR 平滑和有限状态机稳定该循环;在 TotalSegmentator 与 FLARE’22 上,1/5/10-shot 设置下平均 Dice 比最强的固定拓扑 PEFT 基线高 2.4–2.8 分,同时训练参数少于 1%。
把电极坐标当作可学习参数:感知感知优化在折叠皮层上同时提升重建保真度并消除血管安全边界违规
该研究提出一个感知感知的皮层视觉假体手术规划框架,把电极三维坐标当作可学习参数,在FreeSurfer fsaverage折叠皮层几何上用可微假体视觉前向模型端到端优化,目标为最小化任务级感知误差并加入血管避让与灰质可行性约束;在模拟的MNIST阅读任务与CIFAR-10自然图像任务上,该方法相对视觉场平铺与视觉场覆盖基线一致提升重建保真度(MNIST上MSE中位数最多降低67.7%与33.4%,下游分类准确率提升62.6%与22.4%),加入血管惩罚后消除了全部300 µm安全边界违规而SSIM仅下降1.7%(MNIST)与4.4%(CIFAR-10),并可在固定插入预算(Ninsert=128
IMaX 用 Tsallis α-熵替换互信息中的边际熵项,在长尾半监督域泛化下把 ESCA 与视网膜数据集准确率最高提升 7.3 个百分点
该工作指出 FBCSA 与 DGWM 等半监督域泛化方法在长尾类别分布下性能显著下降,提出 IMaX:在带标签样本监督约束下最大化特征与潜在标签的互信息,并用 Tsallis α-熵替代标准边际熵项以放宽类别均衡假设;在 ESCA 组织病理与视网膜糖网分级两个模态、三种 SSL 框架与三种 SSDG 方法上,IMaX 在除一个设置外的所有设置中提升准确率,低标注情形(mL=5)最高提升 7.3 个百分点。
SAW用四个轻量条件信号做手术视频扩散,CD-FVD降至199.19并让稀缺动作识别F1从20.93%升至43.14%
该工作提出Surgical Action World(SAW),把视频到视频扩散重构为轨迹条件的手术动作合成,仅以语言提示、参考首帧、组织可操作区域掩码和2D器械尖端轨迹四个轻量信号为条件,在自建的12,044段腹腔镜视频片段上微调LTX-Video并引入深度一致性损失,在留出测试集上取得CD-FVD 199.19(对比SurgSora的546.82)与FVD 224.28,并展示用生成视频增强稀缺动作后真实测试集上动作识别F1提升(clipping 20.93%→43.14%,cutting 0.00%→8.33%),以及从仿真器导出轨迹渲染器械-组织交互视频的初步可行性。
第 15 页 · 当前显示 10 项