PLOS digital health 2026年9月17日该研究提出并评估了 M3——一个基于模型上下文协议(MCP)的 Python 服务器系统,使研究者能用自然语言查询 MIMIC-IV 重症监护数据库;在 EHRSQL 2024 基准各 100 道可回答与不可回答问题上,Claude Sonnet 4 在可回答问题上达到 94% 准确率、可在消费级硬件本地部署的开源权重模型 gpt-oss-20B 达到 93%(McNemar 检验 p=1.00,未发现可检测差异),而 gpt-oss-20B 在不可回答问题上正确弃答率为 69%,错误主要源于问题歧义与模式映射不匹配。该研究提出并评估了 M3——一个基于模型上下文协议(MCP)的 Python 服务器系统,使研究者能用自然语言查询 MIMIC-IV 重症监护数据库;在 EHRSQL 2024 基准各 100 道可回答与不可回答问题上,Claude Sonnet 4 在可回答问题上达到 94% 准确率、可在消费级硬件本地部署的开源权重模型 gpt-oss-20B 达到 93%(McNemar 检验 p=1.00,未发现可检测差异),而 gpt-oss-20B 在不可回答问题上正确弃答率为 69%,错误主要源于问题歧义与模式映射不匹配。M3:对话式大语言模型简化临床数据的安全访问、理解与分析该研究提出并评估了 M3——一个基于模型上下文协议(MCP)的 Python 服务器系统,使研究者能用自然语言查询 MIMIC-IV 重症监护数据库;在 EHRSQL 2024 基准各 100 道可回答与不可回答问题上,Claude Sonnet 4 在可回答问题上达到 94% 准确率、可在消费级硬件本地部署的开源权重模型 gpt-oss-20B 达到 93%(McNemar 检验 p=1.00,未发现可检测差异),而 gpt-oss-20B 在不可回答问题上正确弃答率为 69%,错误主要源于问题歧义与模式映射不匹配。该研究提出并评估了 M3——一个基于模型上下文协议(MCP)的 Python 服务器系统,使研究者能用自然语言查询 MIMIC-IV 重症监护数据库;在 EHRSQL 2024 基准各 100 道可回答与不可回答问题上,Claude Sonnet 4 在可回答问题上达到 94% 准确率、可在消费级硬件本地部署的开源权重模型 gpt-oss-20B 达到 93%(McNemar 检验 p=1.00,未发现可检测差异),而 gpt-oss-20B 在不可回答问题上正确弃答率为 69%,错误主要源于问题歧义与模式映射不匹配。