跳到主要内容

医学与健康

461 条内容

  1. medRxiv

    用现成大语言模型全自动抽取纵向乳腺肿瘤病历变量

    该研究开发了一套符合HIPAA要求的开源流程,在100例复杂乳腺肿瘤患者(中位病历超过3100页、中位随访6.5年、中位7线治疗)中,用未经微调的现成商用大语言模型从原始未标注的临床笔记、病理报告和用药记录中抽取诊断与复发日期、临床分期、生物标志物亚型、基因检测结果及系统治疗信息,最佳模型在复发状态(99%)、胚系BRCA1/2致病变异(100%)、激素受体(99%)、HER2(96%)、临床分期(91%)、PIK3CA(91%)和ESR1(90%)上与专家一致性很高,抗癌药物抽取接近肿瘤科医生间差异,但精确治疗线重建的患者层面表现仍比第二位肿瘤科医生低9个百分点,四个模型在系统治疗抽取上均优
  2. World Journal of Methodology

    便秘管理:策略演进与方法学挑战的叙述性综述

    这篇叙述性综述梳理了便秘的当代管理策略,涵盖生活方式与饮食调整、药物治疗、行为干预以及针对难治性病例的手术选择,指出传统泻药仍是治疗基石,而促分泌药物、5-羟色胺能激动剂和胆汁酸调节剂等新药拓展了治疗可能,生物反馈和神经调控等非药物手段在特定患者中提供有效替代,同时强调临床试验在诊断标准、终点和随访时长上存在显著方法学差异,限制了结果的可推广性,并指出未来研究聚焦于难治性便秘的个体化治疗、神经源性肠道患者的手术方式以及利用人工智能进行微生物组调控。
  3. World Journal of Methodology

    聊天机器人对“反酸”问题的回答是否准确充分:一项由患者与医生评分的盲法比较

    该研究将39个关于“反酸”(烧心/消化不良/胃食管反流病)的常见患者问题分别提交给ChatGPT-5、Gemini-2.5和Claude-4,由3名胃肠病学家就准确性、全面性、共情和可操作性评分,由20名患者就共情、全面性、可操作性、关怀和有用性评分,并分析可读性指数,结果显示模型间在医生评分的多个维度存在显著差异,Gemini-2.5和Claude-4在准确性、全面性和可操作性上高于ChatGPT-5,Claude-4共情得分最高,患者对各模型的可理解性评分普遍较高,但认为Gemini-2.5和Claude-4的回答比ChatGPT-5更具可操作性,ChatGPT-5的回答可读性最好(约相当
  4. World Journal of Methodology

    定量磁共振与椎体骨质量评分:超越骨密度的脆性骨折风险预测

    本文综述指出,常规双能X线吸收法(DEXA)测量的骨密度只能解释部分骨折风险,而定量磁共振技术(T1ρ、T2 mapping、质子密度脂肪分数、扩散加权成像)与椎体骨质量(VBQ)评分可从胶原完整性、蛋白聚糖含量、水分分布和骨髓脂肪化等维度反映骨质量,VBQ在独立于骨密度的情况下预测椎体脆性骨折,敏感度超过90%,其判别能力与骨折风险评估工具及骨小梁评分相当,结合人工智能可支持无辐射的机会性筛查。
  5. World Journal of Methodology

    前沿技术驱动的胃肠肿瘤相关骨质疏松精准管理:现状、挑战与未来展望

    这篇综述系统评估了人工智能、纳米靶向给药系统与多组学方法在胃肠肿瘤相关骨质疏松(GTO)精准管理中的方法学质量、临床有效性与转化证据,梳理了它们在AI辅助早期筛查与风险预测、纳米靶向骨保护以及基于多组学的“肿瘤—骨—肠轴”机制探索中的应用现状,并讨论了AI泛化能力有限、纳米药物安全性与生产制造难题、多维数据整合与标准化困难、多学科协作不完善及伦理关切等临床转化障碍,指出这些技术有望推动GTO管理从经验实践走向精准医学。
  6. medRxiv

    面向罕见病研究的LLM自然史研究信息抽取流程

    该研究构建了一个概念验证型信息抽取流程,用Athena-v3-AWQ、Gemma3-27B和Llama-3.1-70B-Instruct三个开源大模型从CZI DRSM语料库中标注为“2”的PubMed摘要(金标准集148篇、全语料3,547篇)中抽取11项自然史研究特征,结果显示三个模型成功率均超过99%,Gemma在专家评分(68.0%输出被评为“good”)和全语料运行时间(约16分钟)上综合最优,而Llama在自动Token F1上更高(0.874对0.723),Athena表现最差主要因其倾向逐字复制原文而非综合归纳。
  7. World Journal of Methodology

    致编辑的信:人工智慧与真理的暂时性——对人工智能-人类历史探究的伦理与时间性反思

    这封致编辑的信回应了 Zhou 等人发表于《世界胃肠病学杂志》的关于「人工智慧」(AW)应用于历史医学探究的研究,该研究本身是对一项人工智能与人类协作分析亚历山大大帝死因工作的回应;信件承认生成式人工智能与临床推理相结合的创新性,同时指出其认识论与伦理层面的局限,主张人工智能系统受暂时性数据与迭代淘汰所塑造,无法触及恒久或永恒的真理,大语言模型流畅的说服力可能制造确定性错觉,将概率性综合与智慧混为一谈,因此应强调透明、问责与人类道德守护,并以「认识论守护」取代「人工智慧」这一概念。
  8. World Journal of Methodology

    手术悖论:笔与手术刀——关于改革学术晋升的意见综述

    这篇意见综述指出,当前外科领域的学术晋升体系过度偏重论文数量与科研经费等可量化指标,而相对忽视临床技能的体现,形成所谓“资质认证悖论”;人工智能工具通过简化研究任务进一步放大了这种以发表为中心的文化,使学术职级可能与手术室中的实际能力脱节,并使经费较少以及投入临床照护与教育的教师处于不利地位;作者主张外科界应重新定义学术成功,采用更整体的框架,在科研产出之外正式认可并奖励临床照护、教育与指导方面的卓越表现。
  9. medRxiv

    利用大语言模型从MIMIC-IV临床记录中提取结直肠癌症状

    该研究以MIMIC-IV中2,704份结直肠癌出院记录为数据,用46项症状清单(源自MSAS与EORTC QLQ-CR29)在200份双人裁定金标准上比较了词典规则匹配、预训练临床命名实体识别、零样本Claude Haiku与Gemini 3.5 Flash以及两种“LLM+规则否定过滤”混合方案,结果显示Gemini 3.5 Flash表现最佳(Macro F1=0.70、Micro F1=0.86、Macro Precision=0.74),Claude Haiku次之(Macro F1=0.63、Macro Recall=0.71),两者均明显优于规则法(Macro F1=0.44)与NER(Macro F1=0.
  10. Medinformatics

    面向EGFR抑制剂设计的生成式AI:GPT-2与LSTM模型对比

    该工作通过在约50万条来自ChEMBL数据库的分子数据上微调GPT-2模型,并与在同一数据集上训练的LSTM网络进行基准对比,生成新的EGFR抑制剂候选分子,对生成化合物进行有效性、独特性与新颖性评估,再经Lipinski五规则、合成可及性与类药性评分过滤,并对入选候选物针对EGFR(PDB ID: 1M17)开展分子对接以评估结合亲和力,结果显示GPT-2在生成结构多样分子方面表现突出,而LSTM生成的化学有效分子比例更高,许多候选物与EGFR表现出良好结合相互作用。

第 24 页 · 当前显示 10 项