用AI聊天机器人生成人工耳蜗保险申诉信:准确性与引用可靠性评估
核心概要
本研究让ChatGPT针对非对称性听力损失或单侧耳聋的人工耳蜗保险拒赔情形,以零样本方式生成30种提示变体的申诉信,由三位人工耳蜗提供者按美国人工耳蜗联盟指南评分,并核查引用准确性,结果显示96.6%的回答列出人工耳蜗的多项获益、79.3%部分符合指南,但51.7%含虚构获益,96条引用中仅6条(6.3%)准确指向同行评审来源,其余为虚构(57.3%)、错误(24%)或无关(10%),提示临床与倡导使用前需人工核实。
深度剖析
研究首次系统评估了ChatGPT在人工耳蜗保险申诉信这一具体文书任务上的指南符合度,发现79.3%的回答部分符合美国人工耳蜗联盟指南,96.6%列出了人工耳蜗对非对称性听力损失或单侧耳聋的多项获益。 此前关于大语言模型生成临床文书的研究多集中于通用医学问答或病历摘要,本研究把评估对象聚焦到保险申诉信这一具有明确指南依据、且被作者描述为耗时重复的任务上。 由三位人工耳蜗提供者对29份唯一回答给出87个评分,属于多评分者的小样本评分设计,结果以百分比形式报告。
研究量化了生成内容中的虚构问题:51.7%的回答包含虚构的人工耳蜗获益,96条引用中仅6条(6.3%)准确指向同行评审来源,57.3%为虚构引用、24%为错误引用、10%为无关引用。 该研究不仅评估文本是否读起来合理,还逐条核查引用的真实性与相关性,把大语言模型在专业申诉文书中的引用可靠性作为独立指标呈现。 引用核查覆盖全部96条引用并给出分类计数,样本量有限但分类明确。
研究结论指出ChatGPT生成人工耳蜗保险申诉信的表现不一致,常把符合指南的正确内容与错误或曲解的信息混在一起,因此人工耳蜗提供者在临床或倡导使用前应谨慎并核实AI生成材料。 该结论为临床工作者提供了一个具体的使用边界建议,即把AI输出定位为需人工核验的草稿而非可直接提交的成品。 结论基于上述指南符合度评分与引用核查结果,属于对同一批29份回答的描述性总结。
启示与展望
该研究针对的是非对称性听力损失或单侧耳聋的人工耳蜗保险拒赔申诉信,评估对象为ChatGPT的零样本输出,评分依据为美国人工耳蜗联盟指南,评分者为三位人工耳蜗提供者。其结论适用于把AI生成申诉信作为草稿、并由具备人工耳蜗专业知识的临床人员核实的场景;对于其他病种、其他保险体系或其他语言环境,需要另行评估。
本文为摘要层面的阅读,未包含图表与完整方法细节,因此提示变体的具体设计、评分者间一致性、以及虚构获益的具体类型尚不清楚。读者可继续关注:不同提示策略是否能降低虚构引用比例、引用核查能否自动化、以及在真实申诉流程中人工核实所需的时间成本。
