跳到主要内容
返回时间线
arXiv来源发表:

双智能体框架PsyCIDRA在自由式精神科访谈中提升诊断一致性:留出模拟病例首位命中率60.5%对51.9%,101人研究中与心理学家是否给出诊断假设的一致率为79.6%对65.4%

核心概要

研究者提出PsyCIDRA双智能体框架,由访谈智能体通过工作笔记、专家技能与ICD-11检索开展自由式精神科访谈,再由诊断推理智能体仅依据完整转录生成带支持、冲突与缺失证据的假设报告并在证据不足时不予给出结论;在53例评估队列与81例留出模拟病例上其诊断一致性高于直接提示,101名人类参与者的盲法研究中与心理学家就是否提出诊断假设的一致率为79.6%对65.4%。

Source-provided article image: PsyCIDRA: A Dual-Agent Framework for Psychiatric Interviewing and Diagnostic Reasoning
Figure 1 ·

Figure 1: PsyCIDRA and its evaluation. Simulated patients use PsyCPG-generated profiles. PsyDARA analyzes only PsyCIRA’s visible transcript. Case diagnoses and expert judgments provide simulation and human references, respectively; neither agent sees these references.

arXiv

深度剖析

PsyCPG把临床病例转化为结构化模拟患者档案,并配有事实台账与披露等级控制。 相较直接依据临床病例进行角色扮演,专家对PsyCPG生成患者的平均质量评分由3.83升至4.50(满分5),整体真实性由3.47升至4.50,首位诊断与目标ICD-11编码一致由24/30升至29/30。 两名心理学专家对30对配对病例各访谈一种条件,共60次访谈,使用同一骨干模型与16轮上限,专家对条件、源病例与参考诊断设盲;该质量表为研究自建、尚未做心理测量学验证。

PsyCIDRA将访谈与诊断推理拆分为两个智能体,访谈端用私人笔记、60项专家技能与ICD-11检索工具,诊断端仅接收完整转录并输出结构化报告。 报告按数据充分性、问题表征、证据状态、替代解释、带支持与冲突证据的鉴别排序、不确定性、安全评估与0至3个带ICD-11编码和定性置信度的假设排列,证据不足时最终字段留空。 系统提示、工具、技能目录与报告模式由自然语言处理研究者与心理学家共同设计;工具使用计数为描述性观察,不能建立与诊断表现的关系。

在模拟病例上,完整PsyCIDRA的诊断一致性高于对同一骨干模型的直接提示。 53例评估队列中,四种模型设置下首位命中率提升7.5至15.1个百分点、覆盖率提升5.7至18.9个百分点;81例留出队列首位命中率为60.5%对51.9%,覆盖率为70.4%对60.5%。 评估队列覆盖四种骨干模型与四种访谈/诊断组合,留出队列与评估队列病例不重叠;两队列结果均低于评估队列水平,且留出队列中44/81例落在焦虑/恐惧、强迫相关与心境三组之外。

在101名人类参与者的盲法可行性研究中,PsyCIDRA与心理学家就是否提出诊断假设更常一致。 一致率为79.6%对65.4%;在专家提出诊断的转录中参考编码覆盖率为90.0%对82.6%,差异主要来自专家不予诊断时系统同样保留结论。 两名心理学家独立评审全部101份转录并讨论解决分歧,评审对访谈模式与模型报告设盲;完整系统比较涉及不同参与者,限制了差异归因。

启示与展望

该工作面向希望构建或评估精神科访谈智能体的研究者与临床信息学团队,适用场景是生成访谈转录并输出供合格专家审阅的结构化报告,而非向参与者提供诊断。PsyCPG的输入把源病例与诊断参考同队列级人格设定、专家撰写的社会文化目录、源病例约束的安全设置和预设互动挑战分开,便于在其他病例集合上复用,但需要适配这些输入并重新验证生成的患者。留出队列与人类研究使用评估后冻结的Terra配置,16轮访谈上限是为限制参与者负担而选定,24轮上限未带来一致的首位命中收益。

读者仍需关注若干开放问题:专家与诊断智能体都依赖访谈者获取的信息,专家未进行独立临床访谈、旁证采集或纵向评估,因此一致性衡量的是与专家对现有转录解读的吻合程度,共同遗漏可能带来一致而非诊断正确。文本交互排除了对外观、面部表情、精神运动行为与声音特征的直接观察。人类队列为伊朗的自愿成年参与者,多数年龄在18至34岁且持有学士或硕士学位,不能代表一般人群或临床分层样本。模拟提供受控比较,但不替代真实患者评估。结构化报告不构成对推理过程的忠实解释或临床获益证据,研究未评估临床医生决策、审阅时间或患者结局的改善。安全方面,AISC标记出现在2/52份Direct与3/49份PsyCIRA转录中,其中两例PsyCIRA涉及危机处理,另有每臂一例分析内会话触发实时安全停止,这些计数仅描述分析队列。此外,PsyDARA的置信度为序数标签而非校准概率,其高置信类别仅含五份报告,对专家审阅的实际帮助仍待检验。

来源