Journal of general internal medicine 这项在单一三级学术医疗中心开展的回顾性队列研究,利用2024年入院、住院时长2至14天的成人住院患者随机划分出的验证集(n=860)与测试集(n=886),让大语言模型基于06:00索引时点前30小时的临床文书预测当日出院,发现基线GPT-5提示在验证集上F1为0.48、敏感度为0.37,定性错误分析显示错误最多来自运营流程而非医学知识,而在三种推理期优化策略中,自动提示优化在留出测试集上取得更高的F1与敏感度(但阳性预测值与特异度更低),测试时扩展与专家主导的提示工程改进甚微。