跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

Annals of biomedical engineering

临床人工智能系统中的提示注入:大语言模型与智能体式AI的新兴安全挑战

本文提出,提示注入是一种与准确性、偏见和幻觉不同的失效模式——模型完全按指令行事,但该指令并非临床医生所写、也非其可见;其根源在于当前语言模型架构接收无差别的token流、缺乏区分内容是否具有权威性的机制,而临床记录由转诊信函、患者输入消息、外部报告、扫描文档和外部影像等院外来源材料拼装而成,使医学尤为暴露;作者主张应将提示注入列为患者安全危害并建立明确的威胁模型,认为改进提示词与输入过滤无法解决该问题,可行路径在于具备来源感知的上下文处理、对不可逆操作施加受限权限,以及部署前的对抗性测试。