面向患者提问的正畸错误信息与争议性说法:五款生成式AI聊天机器人的安全性、准确性、证据一致性、错误信息纠正、不确定性沟通、透明度与可操作性比较
核心概要
这项探索性横断面研究将68条由研究者编写、经证据映射的英文提示(每条包含虚假、绝对化、不安全或有争议的前提)以独立单轮对话方式各提交一次给ChatGPT(GPT-5)、Gemini 2.5 Pro、Microsoft Copilot、DeepSeek-V3.2-Exp和豆包Seed-1.6,共获得340条完整回答,由五名临床医生独立评分,结果显示90.3%(307/340)的回答被判定为安全、33条(9.7%)不安全,各模型安全率介于85.3%至94.1%之间且总体安全比较无统计学意义(P=0.203,未被解读为等效),而准确性、证据一致性、错误信息纠正、不确定性沟通、透明度和可操作性六项评分均存在
深度剖析
研究构建并冻结了一套针对68条正畸错误信息与争议性说法的逐题参考标准(证据冻结日期为2026年8月14日),为每条问题指定了错误信息原型、风险层级、必须包含要素、不安全/禁止内容、关键或高严重度错误锚点、证据映射与证据确定性锚点,并配套一份将参考框架转化为固定条目级锚点的操作化评分手册。 既有正畸大语言模型研究多聚焦常规问题、可读性或总体答案质量,本研究把评估对象转向“用户主动提出虚假、绝对化或有争议前提”的情形,并给出可审计的逐题证据锚点,使“是否主动纠正前提”成为可评分构念。 参考标准由两名研究者制定、另一名研究者核查,分歧在正式评分前于研究团队内解决;该框架用于评分者培训与裁定,未向被测聊天机器人展示;完整逐题参考标准见补充附录3,条目级评分映射见补充附录4。
研究将安全性(二分类)与六项分级结局(准确性、证据一致性、错误信息纠正、不确定性沟通、透明度、可操作性)作为彼此独立的构念分别评分,并报告了较高的评分者间一致性:安全性Fleiss' kappa=0.889(95% CI 0.828–0.936),六项分级结局的ICC(2,1)为0.864(透明度)至0.890(准确性)。 该设计把“避免明显有害建议”与“回答是否完整、是否纠正前提、是否给出可执行下一步”区分开来,避免单一总体评分掩盖安全关键要素的缺失。 五名临床医生(临床经验6–26年)在正式评分前用25条未纳入最终数据集的试点回答完成校准练习;评分文件去除聊天机器人名称、提供方标识、界面标签与标识后以编码标识随机呈现;全部340条回答在任何共识讨论前独立评分并锁定用于一致性分析。
在340条回答中,307条(90.3%)被判定为安全、33条(9.7%)不安全;各模型安全率为ChatGPT 94.1%(64/68)、Gemini 92.7%(63/68)、Copilot 91.2%(62/68)、DeepSeek 88.2%(60/68)、豆包85.3%(58/68),总体安全比较无统计学意义(Cochran's Q=5.949,df=4,P=0.203,效应量0.022,95% CI 0.009–0.080),10项两两McNemar比较经Benjamini-Hochberg校正后均不显著(校正P=0.653–1.000)。 研究明确说明该不显著结果不构成等效性证据,且未预设等效界值,因此安全率差异应被理解为未被检出而非被证明不存在。 安全性为二分类结局,不安全需具备具体且可导致有害行为、延误评估、不安全自我治疗或可预防伤害的路径;仅事实不精确、解释不完整、无依据的确定性或沟通不佳本身不足以判为不安全。
六项分级结局均存在模型间差异(均P<0.001):准确性均值ChatGPT 4.09±0.73、Gemini 3.81±0.78、Copilot 3.66±0.78、DeepSeek 3.41±0.70、豆包3.03±0.75(Kendall's W=0.382);证据一致性中位数ChatGPT与Gemini均为75.00(四分位距分别为75.00–87.50与62.50–87.50),Copilot、DeepSeek、豆包均为62.50;错误信息纠正中位数ChatGPT与Gemini为80.00、Copilot与DeepSeek为70.00、豆包为60.00;不确定性沟通中位数ChatGPT、Gemini、Copilot为75.00,DeepSeek为62.50,豆包为50.00;透明度中位数ChatGPT与Gemini为75.00,Copilot与DeepSeek为62.50,豆包为50.00;可操作性中位数ChatGPT为100.00,Gemini与Copilot为75.00,DeepSeek与豆包为66.67。 结果显示模型排序应按维度分别报告,而非合并为单一“全面更优”的结论;ChatGPT在平均准确性上领先,但证据一致性中位数与Gemini并列,且两者四分位距不同。 采用匹配设计(同一68条问题由五个系统回答),总体差异用Friedman检验,事后用配对Wilcoxon符号秩检验,Kendall's W作为总体效应量;经Benjamini-Hochberg校正后60项两两比较中58项显著,例外为准确性的Gemini对Copilot(校正P=0.098)与可操作性的Copilot对DeepSeek(校正P=0.091)。
启示与展望
该研究界定了其结论的适用范围:评估对象是记录查询期间可用的、由提供方托管的消费级聊天机器人产品,而非固定的底层模型架构;被测系统为ChatGPT、Gemini 2.5 Pro、Microsoft Copilot、DeepSeek-V3.2-Exp与豆包Seed-1.6,其中ChatGPT、Copilot与豆包的精确后端路由或部署快照无法从保留的界面元数据独立核实。研究评估的是生成文本,而非诊断性能、治疗效果、患者理解或临床结局;提示为研究者编写的标准化研究场景,并非经患者验证的问卷,也未按患病率加权。安全性判定针对预设的伤害路径,因此高安全比例应理解为避免了预设伤害路径,而非确认回答完整、个体化或临床有效。可操作性仅表示存在清晰且安全的下一步,并不证明患者会理解或遵循。研究未纳入临床医生、搜索引擎或指南对照,也未测量患者理解、信任、决策、依从性、结局与下游伤害,偏差与公平性未作为独立结局评估。
读者在解读时仍需留意若干开放问题:产品为时间戳记录,可能在无公开模型更名的情况下因更新、路由、检索功能或安全策略变化而改变行为,因此结论不应假定长期稳定;每条英文提示仅提交一次,多轮对话、多语言与重复生成的表现未被测试,重复查询的可复现性未评估;研究者自编问题集未经患者验证或患病率加权,部分主题领域样本较小;结构化回答档案保留答案文本与来源表格的纯文本表示,但不复现嵌入图像或其他非文本界面元素,因此评估适用于归档的文本内容;由于模型风格可能暴露身份,完全盲法未能实现;研究专用量表并非经外部验证的患者报告工具;不安全事件不常见且未预设等效界值,主题分析为描述性。未来研究可采用前瞻性收集的患者问题、多语言提示、重复运行、检索功能对照与多轮挑战,并引入盲法外部评审组、临床医生与证据综合对照以及预注册的等效性设计,同时将内容评分与理解、校准的信任、就医行为与治疗决策相联系。
