Studies in health technology and informatics 该研究让五个当前大语言模型(GPT 5.3、Claude Sonnet 4.6、Gemini 2.5 Flash、Perplexity 和 Grok)在相同数据集与标准化提示下复现一项已发表临床工作流中经专家验证的三类统计分析任务——描述性表格生成、Kaplan–Meier生存分析和Cox比例风险建模,并将输出与两位受过数理统计训练的专家的分析在分组正确性、数值准确性、缺失值处理和生成的R代码质量方面进行比较,结果显示所有模型在变量被明确指定后都能给出正确的描述性统计,两个模型因变量名歧义在初始描述性基准中失败但在提示澄清后恢复,所有模型都复现了正确的Kaplan–Meier p值但图形完整性不同,Cox基准