跳到主要内容
返回时间线
Annals of biomedical engineering来源发表:

临床人工智能系统中的提示注入:大语言模型与智能体式AI的新兴安全挑战

核心概要

本文提出,提示注入是一种与准确性、偏见和幻觉不同的失效模式——模型完全按指令行事,但该指令并非临床医生所写、也非其可见;其根源在于当前语言模型架构接收无差别的token流、缺乏区分内容是否具有权威性的机制,而临床记录由转诊信函、患者输入消息、外部报告、扫描文档和外部影像等院外来源材料拼装而成,使医学尤为暴露;作者主张应将提示注入列为患者安全危害并建立明确的威胁模型,认为改进提示词与输入过滤无法解决该问题,可行路径在于具备来源感知的上下文处理、对不可逆操作施加受限权限,以及部署前的对抗性测试。

AI-generated editorial illustration: Prompt Injection in Clinical Artificial Intelligence Systems: The Emerging Security Challenge of Large Language Models and Agentic AI.

深度剖析

将提示注入重新定义为一种与准确性、偏见、幻觉方向相反的失效模式:模型并非未完成任务,而是精确执行了一条临床医生既未撰写也无法看见的指令。 既往临床AI安全讨论集中于模型在既定任务上出错,本文把关注点转向模型“做对了别人让它做的事”,从而把安全议题从模型能力扩展到指令来源的不可见性。 这是一篇论证性文章,其依据是对当前语言模型架构特性的概念分析,而非实验数据或临床样本;文中未报告量化结果。

指出脆弱性源于当前语言模型架构的根本属性:模型接收无差别的token流,缺乏区分“具有权威性的内容”与“不具有权威性的内容”的机制。 把提示注入从个别系统的实现缺陷提升为架构层面的结构性特征,解释了为何该问题不能简单归因于某个产品设计不当。 基于对模型输入处理方式的架构性描述进行推理,属于概念论证,文中未提供对照实验或攻击成功率等实证指标。

论证医学场景的特殊暴露面:临床记录由院外来源材料拼装,包括转诊信函、患者输入消息、外部报告、扫描文档和外部影像。 将通用AI安全问题落到临床信息流的实际构成上,说明外部来源材料进入临床上下文这一常态如何构成风险入口。 以临床记录来源构成的描述性列举为支撑,属于场景分析,未给出各来源的占比或事件统计。

提出应对方向:具备来源感知的上下文处理、对不可逆操作施加受限权限、部署前的对抗性测试;并明确认为改进提示词与输入过滤不足以应对。 把治理重心从“让模型更听话”转向“让系统知道内容来自哪里、能做什么、上线前经过何种检验”,为机构层面的安全设计提供可讨论的框架。 属于规范性主张与建议,文中未报告这些措施的实施效果或评估数据。

启示与展望

本文面向临床AI的开发者、部署机构与安全治理者,适用于临床记录包含院外来源材料(转诊信函、患者输入消息、外部报告、扫描文档、外部影像)的部署环境。其贡献在于提出威胁模型与应对方向,为后续建立来源感知的上下文处理、不可逆操作的权限约束以及部署前对抗性测试提供讨论框架;文中未给出具体技术方案、评估指标或实施步骤,因此其适用性取决于后续工作如何把这些原则转化为可操作的设计与检验流程。

读者仍需关注:提示注入在真实临床工作流中的发生条件与后果尚需进一步刻画;来源感知的上下文处理与受限权限在具体系统中如何落地、如何与现有临床信息系统衔接,文中未展开;对抗性测试应覆盖哪些场景、以何种标准判定通过,也仍是开放问题。此外,本次读取为摘要级范围,未包含图表与完整论证细节,因此对文中论证的完整结构只能作有限概括。

来源