面向临床统计分析的AI“氛围编程”基准测试:肺动脉高压研究中的结构化评估
核心概要
该研究让五个当前大语言模型(GPT 5.3、Claude Sonnet 4.6、Gemini 2.5 Flash、Perplexity 和 Grok)在相同数据集与标准化提示下复现一项已发表临床工作流中经专家验证的三类统计分析任务——描述性表格生成、Kaplan–Meier生存分析和Cox比例风险建模,并将输出与两位受过数理统计训练的专家的分析在分组正确性、数值准确性、缺失值处理和生成的R代码质量方面进行比较,结果显示所有模型在变量被明确指定后都能给出正确的描述性统计,两个模型因变量名歧义在初始描述性基准中失败但在提示澄清后恢复,所有模型都复现了正确的Kaplan–Meier p值但图形完整性不同,Cox基准
深度剖析
研究构建了一个以已发表临床工作流为参照的LLM统计复现基准,覆盖描述性表格、Kaplan–Meier生存分析和Cox比例风险建模三类任务。 相对于一般性的代码生成评测,这里把评估锚定在经两位数理统计专家验证的真实临床分析结果上,并统一了数据集与标准化提示。 基于五个具名模型、三类统计任务和专家对照分析的结构化比较,评估维度包括分组正确性、数值准确性、缺失值处理与R代码质量。
在变量被明确指定后,五个模型都产出了正确的描述性统计;两个模型最初因变量名歧义未通过描述性基准,但在提示澄清后恢复。 说明提示中变量定义的清晰程度会直接影响模型能否通过描述性分析这一基础环节。 来自对五个模型在相同数据集与标准化提示下的直接观察,并记录了失败后经提示澄清的恢复过程。
所有模型都复现了正确的Kaplan–Meier p值,但所生成图形的完整性存在差异;在Cox基准中四个模型复现了全部所需风险比项,一个模型遗漏了交互结果。 把评估从数值正确性延伸到图形完整性与模型间在交互项处理上的差异。 基于与专家验证分析的逐项对照,涵盖p值、风险比项与交互结果。
总体结论是LLM可能支持临床研究工作流,但其输出在使用前仍需仔细验证。 为临床统计场景中引入LLM辅助提供了以复现性为核心的初步证据基础。 结论由上述三类任务的模型间差异与专家对照结果共同支撑。
启示与展望
该评估面向的是在给定数据集与标准化提示下复现已发表临床工作流中的三类统计任务,适用于希望借助LLM辅助描述性统计、生存分析与Cox建模的临床研究团队;其结论针对的是变量被明确指定、并有专家验证结果作为对照的分析设置。
所载文本为摘要层面的信息,缺少图表与完整方法细节,因此各模型在缺失值处理与R代码质量上的具体表现、图形完整性差异的具体内容、以及交互结果遗漏对结论的影响程度,仍是读者需要结合原文进一步确认的开放问题;此外,模型版本与提示设计的变化可能影响复现表现。
