跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

Studies in health technology and informatics

面向临床统计分析的AI“氛围编程”基准测试:肺动脉高压研究中的结构化评估

该研究让五个当前大语言模型(GPT 5.3、Claude Sonnet 4.6、Gemini 2.5 Flash、Perplexity 和 Grok)在相同数据集与标准化提示下复现一项已发表临床工作流中经专家验证的三类统计分析任务——描述性表格生成、Kaplan–Meier生存分析和Cox比例风险建模,并将输出与两位受过数理统计训练的专家的分析在分组正确性、数值准确性、缺失值处理和生成的R代码质量方面进行比较,结果显示所有模型在变量被明确指定后都能给出正确的描述性统计,两个模型因变量名歧义在初始描述性基准中失败但在提示澄清后恢复,所有模型都复现了正确的Kaplan–Meier p值但图形完整性不同,Cox基准