跳到主要内容

日报

AI 与科学前沿 · 2026-09-16

仅汇集当天已送达公开发布边界的内容。

arXiv

驯服智能体化RAN:O-RAN中自主AI智能体的稳定性保证仲裁

该工作在真实O-RAN测试床上演示了两个各自目标正确的自主智能体(一个保护时延SLA、一个追求能效利用率)会共同引发共享资源划分的反复反向偏移,并提出并证明了一个轻量仲裁层AURA,通过可行性不变量、逐变量驻留时间和死区三项准入检查,将共享状态偏移幅度从8.4降至0.4 PRB、将跨切片吞吐饥饿从40–55%降至0.3%,同时不改善受保护切片自身的时延合规率。
arXiv

EviGen:以预测性证据脚手架生成可验证的临床推理依据

EviGen 提出一个三层框架,先用基于结局标签训练的可学习查询按预测贡献(而非文本相关性)检索并排序患者纵向电子健康记录中的证据,再让大语言模型在该证据脚手架内生成带引用编号的临床推理依据,最后由过程监督验证器逐步核查并标记不可靠推理;在 MIMIC-IV 一年死亡率、自闭症与 ADHD 三个任务上,其预测表现与推理依据忠实度优于全上下文与 RAG 基线,并在临床评审试点中被多数评审者首选。
arXiv

让工具自己报告进度:智能体工具调用已持有进度信息,服务系统应当读取它

该工作提出让运行中的工具调用显式报告自身进度(剩余工作量或临近结束信号),通过对四个公开智能体语料库的普查、一个不改变智能体可见输出的采集框架、与四个已发表预测器的对比,以及在 vLLM 中通过少量提示接入的端到端评测,发现所报告进度在 KV 缓存决策点上比最佳已发表预测器准确数倍至一个数量级,并在环境变化时保持准确,使工具调用后的 p90 首 token 时间相对 LRU 降低 20.7%(仅 HBM)与 20.8%(HBM + DRAM),接近 oracle 水平。
arXiv

无限参数 LLM:从实时数据生成并适配权重

该工作提出“无限参数 LLM”架构:用一个紧凑超网络把运行时提供的数据(事实、指令、示例)编码为低维隐码,再由该隐码生成对共享基础前馈网络的低秩加性调制,从而在不存储专家库的前提下按 token 生成“专家”,并进一步对隐码维持一个贝叶斯信念、随会话在线更新,使有效权重在会话中持续演化;作者同时给出评估协议,把“把知识放进权重”与“把知识放进提示”在同等预算下直接对比。
arXiv

对数凹Holant测度的无度依赖谱独立性

本文在简单图上为对数凹Holant问题建立了不依赖最大度数的谱独立性上界,并由此得到单体-二聚体模型在活度λ下Glauber动力学的弛豫时间O_λ(m)、b-匹配在逸度λ>0下的O_{b,λ}(m),以及均匀b-匹配的O(bm),其中m为边数。
arXiv

用OCR头把图像语义“说出来”:视觉语言模型中的泛化言语化头与言语化透镜

该研究在四个视觉语言模型(Qwen3-VL-2B、Qwen3-VL-8B、Molmo2-7B、Llava-Next-34B)中定位出对OCR因果必要的注意力头,发现它们其实是通用的“言语化头”,把这些头的输出-值(OV)矩阵求和构成一个“言语化透镜”后,可在任意层(包括第0层)把图像token的隐藏状态解码为可解释的语义词,并可用其伪逆构造概念向量来编辑图像表征(如把“拖拉机”替换为“左轮手枪”),从而为“图像表征在早期层就与语言空间对齐”提供了证据。
arXiv

组合式策略违规:当智能体工作流中的逐步合规失效

本文提出并形式化了“组合式策略违规”(CPV)这一治理失效模式:在智能体工作流中每一步都通过各自的局部检查,但组合后的执行却违反整体策略,作者据此给出四类分类(权限蔓延、阈值洗白、累积求和违规、上下文坍塌)、指出每类所需的修复拓扑由被守护量在何处发生变化决定,并提出一套基于溯源感知的运行时检测架构,从原始溯源重算被守护量而非信任流水线的派生表示。
Terence Tao blog RSS

证明、提示与帖子:一个关于数学中人工智能的社区博客

这是一篇由《Proofs and Prompts》博客编辑撰写的客座文章,介绍了该社区博客的创办缘由与目标:在数学界围绕人工智能的讨论日益升温之际,为缺乏发声平台的数学家(尤其是博士生等群体)提供一个集体发声与辩论的空间,并报告了创办约一个月后作者群体涵盖博士生、本科生、菲尔兹奖得主与爱好者,以及投稿立场从呼吁暂停AI到认为AI参与不足等多元观点,同时指出作者背景在LLM经验、地域和性别上仍显集中,呼吁更多人投稿。
arXiv

ProgramDistill:把交互式网页应用转化为可验证的参考引导式软件工程任务

该工作提出 ProgramDistill 基准与全自动 mine–craft–patch 流水线,将 26 个交互式网页应用分解为 1,975 条可重放验证的行为并构建 4,063 个任务,让编码智能体在隐藏源码的情况下通过交互参考应用推断并恢复缺失功能,结果显示九个前沿智能体在完整应用重建中最高成功率 49.2%,且随恢复深度从 1 增至 8,部分应用重建成功率从 100% 降至 64.0%、从 96% 降至 32%。
arXiv

在最短路径总长之下路由多智能体:Transient Multiagent Pathfinding 的参数化复杂度刻画

该工作研究 Transient Multiagent Pathfinding(智能体到达终点后立即消失的无碰撞多智能体路径规划),以顺序路由给出的上界 L=1+Σdist(si,ti) 与目标完工时间 λ 之间的差距 ζ=L−λ 及智能体数 k 为参数,证明该问题在 k+ζ 下固定参数可解(2^{O(k²ζ)}·n^{O(1)}),并给出 k 单独参数化 W[1]-难、ζ 单独参数化在终点可重复时 W[1]-难、k+ζ 下不存在多项式核的下界,同时证明当所有终点互不相同时问题仅以 ζ 为参数也是固定参数可解(2^{O(ζ³)}·n^{O(1)})。
arXiv

AdaGeoVLN:在表示深度与导航时间两个维度上选择性使用几何信息

该工作提出 AdaGeoVLN 流式视觉语言导航框架,将 VGGT 几何基础模型在深度 11、17、23 的中间表示分别耦合到 Qwen3.5-4B 的前三个解码层,并按指令相关性、几何置信度与转移新颖度在固定预算下保留历史 VGGT 全局注意力 KV 状态,在 R2R-CE 与 RxR-CE Val-Unseen 上仅用单路 RGB 流、不额外使用导航专用外部数据即取得 55.7%/51.4% 与 54.1%/44.7% 的 SR/SPL,消融显示多深度耦合显著优于在相同融合位置重复注入末端特征,且受限的导航感知保留在降低 GFM-KV 内存的同时保持导航性能。
arXiv

CERA-MoA:路由机制与持续学习智能体协同演化的混合智能体框架

该工作提出 CERA-MoA,一个迭代式强化学习框架,让动态路由器与多个独立智能体策略协同演化:路由器用基于中间层隐状态的预测式熟悉度估计器在生成前评估各智能体对查询的语义胜任度,并以累积阈值自适应路由激活最小智能体子集,同时依据智能体不断变化的能力主动分配针对性训练样本,从而在多个领域上优于静态智能体路由与固定工作流微调基线。
NVIDIA Research

NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首秀中取得领先性能

NVIDIA 在 MLPerf Inference v6.1 中首次提交 Vera Rubin NVL72 预览结果,在 Qwen3-VL 上吞吐量最高达 GB300 NVL72 的 3.7 倍、在 DeepSeek-R1 上最高达 2.5 倍,同时 GB300 NVL72 以 288 GPU 四机架实现 99% 扩展效率,软件优化较 v6.0 提升最高 1.6 倍。
arXiv

TeleAntiFraud 2.0:可刷新、基于画像、以音频为载体的电信诈骗检测基准

该工作提出 TeleAntiFraud 2.0,一个以月度冻结快照形式组织的可刷新中文电话音频基准,通过混合树反诈生成流水线把网络诈骗案情摘要转化为共享情境、仅在带标签行为处分叉的诈骗与近域合法姊妹对话,并渲染为角色匹配语音;每个冻结集含 900 通中文电话(600 诈骗、300 近域非诈骗),受控文本实验显示三类分类器在无关或普通负例上达到完美 Macro-F1,而在近域姊妹负例上降至 0.65–0.68,全量音频与 ASR+LLM 评测进一步揭示类别先验捷径、预测坍缩与快照敏感性。
arXiv

面向低资源语言的自动化NER标注纠错可扩展框架

该工作提出一个多步骤框架,先用ChatGPT-4o做词切分纠正、再用词频阈值≥3的实体词典做上下文无关的实体补全,最后以基于频率的迭代自训练配合logits概率阈值与自注意力90百分位双阈值筛选伪标签、并用多语言XLM-RoBERTa-large按F1挑选候选,在乌尔都语MK-PUCIT、Shahmukhi(西旁遮普语)与信德语SiNER三个人工复核的验证/测试集上,微调XLM-RoBERTa-large后测试集micro-F1分别提升3.96、1.40、1.44个点,同时报告ChatGPT-4o零样本/少样本NER的表现低于有监督模型。
arXiv

用工具增强的演绎推理让大语言模型“线索”更清晰

该工作把经典桌游《Clue》改造成文本多智能体环境,用GPT-4o-mini与Gemini-2.5-Flash各三名玩家进行18局游戏,并引入一个维护“可能性矩阵”(YES/NO/MAYBE及accusation_ready信号)的外部工具来外化信念状态跟踪,结果显示工具增强玩家的指控准确率接近满分(Gemini-2.5-Flash达1.00、GPT-4o-mini达0.96),混合局中未用工具的玩家准确率也从基线约0.81/3提升到约2.71/3,但工具并未改变智能体在已知答案后仍延迟指控的决策自主性。
arXiv

哪个大语言模型最擅长把自然语言目标翻译成 PDDL

本文设计了一个经过迭代优化的提示模板,让六个当代大语言模型把视频游戏测试人员用非正式语言写成的测试目标翻译为经典规划所需的 PDDL 目标,并在 90 条自然语言目标(45 条可表达、45 条不可表达,覆盖 8 个领域)上系统评估其正确率、响应速度与错误倾向,结果显示所有模型正确率均超过 92%,其中 Gemini 2.5 Flash 正确率最高达 96% 且假阳性最少,GPT-4.1 响应最快。
NVIDIA Research

Emerald AI、Google 与 NVIDIA 发起联盟,推动柔性 AI 数据中心

Emerald AI、Google 与 NVIDIA 宣布成立 AI Energy Management Alliance(AEMA),这是一个汇聚 AI 与电力全价值链的联盟,主张以技术中立、基于性能的方式让数据中心动态管理用电,从而加快并网、增强电网可靠性并保护电价可负担性。
OpenAI

用AI重塑广告:OpenAI推出Sponsored Agents与营销工具

OpenAI发布了一篇介绍其AI驱动广告体验的文章,涵盖Sponsored Agents、面向营销人员的工具以及与HubSpot和Shopify的集成,旨在探索广告在AI时代的新形态。
MIT Technology Review

为AI构建材料基础:Syensqo谈先进材料与AI的双向驱动

这篇由MIT Technology Review Insights制作、与Syensqo合作的对谈文章,记录了Syensqo首席技术与创新官Mike Finelli的观点:AI正把半导体和数据中心推向物理极限,从而对先进材料提出更多叠加要求,而Syensqo一方面开发高压数据中心架构材料、半导体制造密封材料与直接浸没冷却流体等方案,另一方面与微软合作使用AI智能体对海量候选分子进行数字化合成、基于物理的模拟预测与排序,把实验室合成范围从数百万个候选缩小到约一百个,并主张把可持续性纳入研发起点。
MIT Technology Review

《The Download》通讯:AI 的万亿美元赌注与 OpenAI 出资构建生物学数据

这是一期 MIT Technology Review 的每日通讯《The Download》,汇总了多条科技动态,其中重点包括:一项以超大规模云厂商到 2027 年近 1.1 万亿美元数据中心支出为起点、推算其盈利需多快增长才能在 2030 年前收支平衡的金融分析,以及 OpenAI Foundation 宣布资助政策分析师 Ruxandra Teslo 提出的、通过破产程序获取失败生物科技公司监管文件与安全数据以构建“生物科技失落档案”式科学数据集的构想。
OpenAI

如何将 AI 使用情况与业务价值连接起来

这篇 OpenAI 文章介绍如何借助 ChatGPT Work 与 Codex 的分析功能,帮助团队了解 AI 的使用情况与支出、识别培训需求,并把 AI 采用情况与业务成果联系起来。
Mistral AI

Mistral 与 Mozilla 合作:把开放、私密、多语言的 AI 带入浏览器

Mistral 与 Mozilla 宣布合作,由 Mistral 模型为 Firefox 的 AI 浏览助手 Smart Window(测试版)提供支持,先在法国和北美上线,英国和德国预计今年晚些时候跟进,并强调开源分发、按地区语言与方言微调、默认不保存对话与零数据留存,以及把主权 AI 带给普通用户。
OpenAI

OpenAI 经济研究:工作者如何用 AI 解锁新的工作方式

OpenAI 经济研究发布的一项分析指出,工作者正在把 AI 用于传统岗位职责之外的用途,并识别出其中哪些新活动会逐渐成为其日常工作中反复出现的固定环节。
NVIDIA Research

曼彻斯特大学利用 NVIDIA Earth-2 预测英国全境空气污染

曼彻斯特大学物理学家 David Topping 与 Hao Zhang 联合 NVIDIA Earth-2 团队,将原本用于天气的生成式模型迁移到空气质量预报:他们用一年英国逐小时化学-气候模拟数据训练 Earth-2 CorrDiff 生成式降尺度模型,在 Isambard-AI 单个八 GPU 节点上两天完成训练,得到 2-3 平方公里分辨率的英国全境污染模型,并加入 Earth-2 StormCast 实现直接使用空气质量观测的时间依赖预报,同时演示了在 DGX Spark 桌面 AI 系统上运行推理与小型训练,团队计划开源训练数据与工作流以便其他国家与地区训练本地模型。
ORBi UMONS

GHAgentFiles:GitHub 仓库中编码智能体文件历史数据集

该工作构建并公开了 GHAgentFiles 数据集与开源提取工具 cofee,从 165,281 个候选 GitHub 仓库中识别出 27,717 个含编码智能体文件的仓库,提取出 142,294 条上下文、技能与子智能体文件历史(共 401,873 次文件修订、185,795 次提交,时间跨度自 2022 年 11 月 22 日至 2026 年 7 月 1 日),并给出初步观察性分析,显示编码智能体文件自 2025 年初开始出现、2026 年初出现新增与修改的峰值,且通用 AGENTS.md 已成为最流行的命名实践。
Diagnosis (Berlin, Germany)

多智能体AI模拟器用于临床推理练习的早期证据:表现、一致性与挑战

本研究让175名二年级医学生在2024年秋季完成三次MAESSCR多智能体LLM临床情境模拟,并由六名临床教育者用二分评分工具评估120份随机抽取的对话记录,发现脚本依从性达92%(110/120)、改变诊断的信息仅2.5%(3/120)、不真实患者呈现12%(14/120)、技术问题17%(20/120),而智能体最突出的问题是提前解读检查结果、干扰学生独立推理,分别出现在28%(34/120)的病史/体格检查智能体和59%(71/120)的诊断/管理智能体情境中,多数干扰较轻微。
Journal of medical imaging and radiation sciences

影像组学在神经肿瘤学中的应用:进展、临床应用与实施挑战的叙述性综述

该叙述性综述检索了PubMed、Scopus和Web of Science(2012—2024年)的文献,梳理影像组学与人工智能在神经肿瘤学中的诊断、预后和治疗潜力,指出影像组学可从MRI、CT和PET/CT中自动提取人眼难以察觉的定量特征,已显示在胶质瘤术前分类、生存预测以及区分肿瘤进展与假性进展方面具有价值,与深度学习结合可能提升诊断准确性并支持基于IDH、MGMT等分子标志物的患者分层,影像基因组学则将影像表型与基因改变相联系以促进个体化医疗,但方案缺乏标准化、分割变异以及经过验证的多中心研究稀缺等局限仍然存在,因此在最终融入临床实践之前仍需前瞻性验证与方法学标准化。
Science advances

微波衍射神经网络芯片:在毫米级GaAs芯片上同时实现感知与计算

该工作采用GaAs半导体工艺制备了芯片级微波衍射神经网络(MDNN),通过级联耦合器与移相器在毫米级尺寸内实现衍射网络,将传统MDNN尺寸缩小四个数量级以上,计算延迟为2.05 ns,系统级能效为0.83 TOPS/W,并在MNIST手写数字识别、多用户干扰抑制和无人机实时障碍感知三个原型任务上取得超过86%的准确率,验证了该芯片在微波域直接进行数字图像处理与原位电磁信息处理的能力。
JMIR Medical Education

AWARE 框架:在精神卫生诊疗中评估患者使用对话式 AI 的教育性访谈框架

本文提出 AWARE(AI 使用、原因、依恋、现实与风险、对功能的影响)框架,作为帮助精神卫生专业人员系统评估患者使用对话式 AI 的教育性访谈工具,围绕五个临床相关领域组织提问,并讨论将其纳入本科、研究生与继续专业教育的途径及未来研究重点。
medRxiv

急诊医学人工智能能力框架:一项多阶段共识研究

该研究通过名义群体技术(2025年5月,n=6)与两轮改良德尔菲法(2026年4月至5月,专家组n=13,来自12家学术医学中心,第一轮应答率77%、第二轮100%)构建了美国首个专科特异性的急诊医学AI能力框架,最终形成5个主题(沟通AI、理解适用场景、与AI互动、AI风险管理、AI的认知影响)、5项派生能力(主题与能力一对一映射获13人中12人认可)、19个子主题和10个保留临床场景,所有主题、派生能力及被单独评分的子主题均达到预设共识阈值,10个场景中9个达到共识、1个作为未来态运行模型保留。
Clinical therapeutics

医疗器械全生命周期安全:监管框架、数字化转型与人工智能在器械与监测中的作用

这篇叙述性综述通过检索PubMed与ScienceDirect(2016—2026年,另加2013—2026年临床研究专题检索)并补充FDA、EMA、Cochrane Library等监管与行业文献,梳理了医疗器械从早期设计、临床研究、监管审评到上市后监测、软件变更管理、网络安全与AI/ML器械监管的全生命周期安全问题,指出器械安全需要比药品更广的社会技术框架,并强调安全证据正从回顾性、被动报告转向实时、主动、基于全生命周期的证据生成。
JMIR Medical Informatics

基于常规电子健康记录数据的院内谵妄预测模型:系统综述

该系统综述检索PubMed、MEDLINE、Embase、PsycINFO与Web of Science(自建库至2025年11月11日),纳入29项使用常规采集的电子健康记录或行政数据开发、验证或评估成人住院期间急性精神状态恶化(均操作化为谵妄)多变量预测模型的研究,按CHARMS与TRIPOD/TRIPOD-AI提取数据、以PROBAST评估偏倚风险,发现证据集中于入院或早期风险分层、围手术期或术后预测、重症监护动态预测以及既有工具的外部验证或工作流评估四类任务,多数为回顾性队列(20/29,69%),机器学习或混合方法常见(18/29,62%)但未稳定优于统计或规则方法,24项(83%)报告
ACM Computing Surveys

面向语言模型的混合精度量化:技术综述与前景展望

这篇综述系统梳理了面向语言模型的混合精度量化框架(MXPLMs),先回顾量化基础(均匀与非均匀量化器、量化粒度、训练后量化方法),再按比特分配策略以及权重、激活与键值缓存的精度配置对近期框架进行分类比较,并对比早期深度神经网络混合精度方法,指出可迁移的策略与在语言模型场景中面临挑战的策略,最后总结硬件感知设计、激活量化与十亿参数级模型可扩展优化等开放问题。
发表出处待核验

信息满足度:以读者为中心的摘要评估新维度

本文提出以“信息满足度”(查询加读者画像)作为摘要评估的新维度,通过五类扰动测试与一项专家人工评估发现,ROUGE、BERTScore 等传统指标以及 Llama-3.3-70B、Prometheus-7B 等 LLM 评判指标大多无法通过基本扰动检验,且与读者偏好的一致性接近随机水平,说明现有指标不足以衡量摘要对特定读者的信息满足度。
Figshare

《制度窗口:合同法如何约束生成式AI下人类后备能力的责任信号》复现包(v1.3.1.1)

该复现包为Bauer(2026)的论文提供完整可验证材料:论文研究当生成式AI使产出本身不再具有信息量时,责任承诺何时仍能证明提供方保留了人类后备能力,并用四项法律原语把公布的责任上限与约定赔偿条款映射为留存风险,给出低类型在零处混同、中间类型在锚定于F的日程上分离、高类型可能在顶棚处混同的消息集合{0}∪[F,C],以及在法律移除零风险区间时分离从最低类型开始的结果。
Biologia futura

微生物多样性:地球生命的必要基础

这篇综述指出,微生物多样性支撑人类健康、农业生产力、生态平衡与生态系统功能,并梳理了微生物组在人类肠道免疫调节与代谢、疾病预防中的作用,以及在陆地生态系统中植物、真菌、细菌与土壤微生物互作对碳固存、养分循环、抗逆性和可持续农业的贡献,同时评述了精准益生菌、后生元、粪菌移植与个性化微生物组医学等新兴疗法,以及多组学技术、合成微生物基因组、微生物组工程与人工智能推动的农业、环境修复和医学应用,并指出生态复杂性、长期验证、标准化与田间规模化应用等尚存问题,强调保护微生物多样性对生态韧性与One Health框架的意义。
Climatic Change

生成式辟谣:用大语言模型自动生成气候变化虚假信息的“真相三明治”式反驳

本研究提出“生成式辟谣”框架,将气候变化反智主张分类(CARDS)与谬误检测(FLICC)整合进大语言模型的提示流程,使模型接收一条气候迷思后输出符合“事实—迷思—谬误—事实”(真相三明治)结构的辟谣文本;作者用三种复杂度递增的提示策略分别搭配GPT-4、Palm2与Mixtral,并由四位作者(含一位气候虚假信息专家)对20条迷思生成的60份辟谣按事实、谬误、结构分项评分,结果显示GPT-4配简单提示与Mixtral配结构化提示表现较好,谬误解释得分普遍高于事实部分,且非专家标注者与专家之间在事实质量上一致性较差。
Current oncology reports

鼻咽癌监测策略的最新进展:从指南随访到个体化精准监测

这篇综述系统梳理了鼻咽癌(NPC)现有随访方案与最新进展,一方面比较分析了主要随访指南中的随访频率、影像学手段(MRI、PET)、血浆EBV-DNA监测与功能评估,另一方面阐述了基因组学、影像组学和人工智能在NPC监测中的应用前景与研究进展,并指出基于条件生存模型等风险分层的个体化随访策略可提升监测的成本效益,而影像组学与人工智能在复发风险评估、预后分层和个体化监测方面展现出潜力。
BMC Geriatrics

大语言模型老年用药审查输出的质量与安全性:两阶段情景化基准评价

该研究以20个标准化老年药物治疗情景(虚构72–88岁老年人,覆盖四个临床领域,每个情景含三种潜在不适当用药和一项START类遗漏,锚定AGS Beers标准与STOPP/START第3版)让GPT-5.2、Claude Sonnet 4.5和Gemini 3 Pro在相同主提示与默认终端设置下作答,由两名对模型身份设盲的老年医学专家用100分评分表(输出质量0–80分、关键安全风险优先级0–20分)独立评分,发现第一阶段条目层面与答案要点的一致性普遍很高、模型间区分度有限,而专家评定的总分存在显著差异(p<0.001;Kendall's W=0.700),Gemini 3 Pro最高(97.93±2.33)
Chemical Society reviews

下一代锂离子电池的富锂正极补偿剂:分类框架、挑战与协同预锂化策略

这篇综述针对锂离子电池首次循环与长期运行中的活性锂损失问题,建立了基于锂补偿机制的富锂正极补偿剂(LRCs)分类框架,涵盖二元、三元、过锂化、牺牲型锂盐与缓释型五类,系统梳理其工作原理、电荷补偿路径与实际性能,讨论空气不稳定性、产气、高脱锂电压与加工问题,并归纳纳米化、表面包覆、缺陷与掺杂设计及电解液优化等缓解策略,进而提出将一次性预锂化与持续释锂相结合的多模式协同补偿策略以及AI驱动的正极、负极与电解液协同优化思路。
JMIR Formative Research

焦虑青年对生成式AI的问题性依赖:一例病例报告

本病例报告描述一名二十多岁、患有广泛性焦虑障碍与重性抑郁障碍、既往社会与职业功能良好的女性,逐渐对ChatGPT形成功能性依赖,将撰写邮件、解读社交互动、预测未来与做决定等日常认知和人际任务外包给AI,并在独立完成这些任务时愈发不适,作者以I-PACE模型刻画这种认知卸载、独立判断信心下降与思维外化的模式,并提示AI的无限可及性可能强化寻求安慰行为、削弱对不确定性的耐受。
Mendeley Data

从5,597篇文献构建的腐蚀抑制剂数据集

该工作以多智能体抽取流程从5,597篇文献中整理出腐蚀抑制剂数据集,包含经人工核验的IE_datasets.xlsx、由大模型抽取的json_extracted.zip以及用于建模的IE_PH_4_materials.xlsx,字段覆盖文献信息、抑制剂名称与组成、阳极/阴极/混合类型、成膜机制、SMILES、腐蚀材料及其牌号与热处理、腐蚀介质与浓度温度、以及测试温度、时间、抑制剂浓度、测试方法与缓蚀效率百分比。
ACM Journal on Computing and Sustainable Societies

提示的不可承受之轻:设计教育中使用生成式AI的环境影响批判性反思

该论文以2023年一场有49名学生参与的研讨会为动因案例,批判性地反思了设计教育中使用生成式AI的能源成本,并提出五组替代立场及相关行动,以支持在设计教育中有意识地使用生成式AI。
Bioscience Reports

卵巢癌的表观遗传机制与临床转化:从分子通路到精准治疗

这篇综述系统梳理了卵巢癌中DNA甲基化、组蛋白修饰、染色质重塑和非编码RNA等表观遗传机制如何驱动化疗耐药与复发,并汇总了表观遗传药物(DNMT、HDAC、EZH2抑制剂)与PARP抑制剂或免疫治疗联用的临床试验结果,以及基于循环cfDNA甲基化、循环miRNA和人工智能液体活检平台的生物标志物进展,提出以表观遗传状态进行患者分层和实时监测耐药的精准肿瘤学框架。
Neurotherapeutics : the journal of the American Society for Experimental NeuroTherapeutics

加速发现:神经肿瘤学中变革性的临床试验模型

这篇综述提出并梳理了一套面向中枢神经系统肿瘤的临床试验新框架,包括主方案设计、贝叶斯自适应框架、将试验作为嵌入纵向组织取样与窗口机会设计及多组学分析的主动发现平台,以及去中心化试验与人工智能工具,主张把临床试验重塑为动态、生物学整合、基于学习的系统,而非对单一药物的静态检验,以加速神经肿瘤学的治疗进展。
Trends in pharmacological sciences

通过协调监管弥合AI药物监管缺口

该文指出,人工智能在加速药物发现的同时也带来了监管缺口,目前已有超过100个AI辅助研发管线进入临床试验,而现有框架缺乏可执行的统一标准;作者据此提出一个风险分级框架,将“发现型AI”与“证据生成型AI”区分开来,要求在AI影响决策时强制开展影响评估并进行新药临床试验申请(IND)披露,从而把指南转化为具有约束力、与风险相称的监管。
European archives of oto-rhino-laryngology : official journal of the European Federation of Oto-Rhino-Laryngological Societies (EUFOS) : affiliated with the German Society for Oto-Rhino-Laryngology -

人工智能在耳鼻咽喉头颈外科中的应用:现状、局限与未来展望

这篇叙述性综述通过检索 PubMed/MEDLINE、Scopus 与 Web of Science,梳理了人工智能在耳鼻咽喉头颈外科各亚专科中的临床应用,指出深度学习在鼻窦疾病检测、图像自动分割、淋巴结转移预测、甲状腺结节分类及头颈肿瘤预后建模等方面显示出潜力,多模态系统与生成式大语言模型亦在医学教育、影像解读、鉴别诊断与临床决策支持中初现应用,但外部验证不足、回顾性设计、数据集异质性、算法偏倚、透明度欠缺、隐私与医疗法律不确定性以及自动化偏倚风险仍限制其广泛落地,因此作者认为人工智能目前更适合作为辅助工具,尚需前瞻性多中心研究与标准化验证框架。
bioRxiv

细胞类型在描述神经元生理特征上的意外有效性

该研究利用来自神经外科组织的495个人类神经元的配对转录组与电生理膜片钳测序数据,比较了传统转录组细胞类型分类、基于大规模scRNA-seq预训练的基础模型scGPT表征、离子通道编码基因以及高变基因对电生理特征的预测能力,发现簇级细胞类型表征总体优于高变基因选择、离子通道基因选择和上下文增强的scGPT嵌入,且最佳结果来自将独立的细胞类型模型与scGPT模型输出相结合。
medRxiv

大语言模型从MIMIC-IV临床记录中提取的结直肠癌症状群及其与患者结局的关联

该研究使用零样本大语言模型流程(Gemini 3.5 Flash 与 Claude Haiku)从 MIMIC-IV 中 1,507 名结直肠癌患者的 2,728 份出院记录里提取 46 种症状,基于 phi 相关(≥0.10)与 Louvain 社区检测构建患者层面症状共现网络,两种模型均收敛于三个临床可解释的症状群——全身性、结直肠癌疾病特异性与胃肠道症状群,且全身性症状群负担与院内死亡(OR=1.33)和 1 年死亡(OR=1.41)相关、结直肠癌疾病特异性症状群负担与 30 天再入院(OR=1.20)相关,这些关联在调整转移性疾病后依然稳健。
medRxiv

面向视网膜OCT B扫描的任务特异性质量门控:在脉络膜分割中学习表征优于标量指标

该研究以脉络膜分割为原型任务,在80名受试者的6,076张OCT B扫描上系统比较标量无参考图像质量指标(BRISQUE、NIQE、PIQE、SNR、PSNR)、通用ImageNet预训练表征与视网膜基础模型作为任务特异性质量门控信号,发现标量指标与分割Dice相关性极弱(|r|<0.20),通用预训练表征线性探针ROC-AUC最高约0.77,而OCT特异性基础模型RETFound达到约0.81,且仅视网膜基础模型的嵌入空间在无监督K-Means下产生超过患者级置换零分布的按质量对齐聚类。
RNA Biology

HyLnc:融合深度上下文嵌入与手工序列特征的长链非编码RNA预测框架

该研究提出HyLnc框架,先用掩码语言建模在大型后生动物RNA序列语料上预训练一个定制的BERT模型,再在长链非编码RNA与蛋白编码转录本数据集上微调并提取256维深度嵌入,同时计算348个手工特征(含ORF特征、UTR属性、核苷酸组成与Fickett分数),经多阶段特征选择后由多种机器学习分类器评估,其中随机森林表现最佳,在独立验证集上取得91.30%准确率、91.23% F1分数与82.60 MCC,优于若干现有lncRNA预测工具。
Aesthetic Surgery Journal

乳房重建美学效果评估的当前概念与新兴技术:一项系统综述

该系统综述检索2000至2025年间评估植入物、自体或混合乳房重建美学效果的研究,纳入来自16个国家的51项研究、共7711名参与者,将评估工具分为主观与客观两类,发现主观工具以BREAST-Q为主(35/51,69%),客观方法见于19项研究,包括三维表面成像(8/51,16%)、BCCT.core(7/51,14%)、眼动追踪(3/51,6%)和基于人工智能的分析(3/51,6%),并指出尚无单一模态能全面覆盖所有美学维度,评估正逐步转向多模态整合。
bioRxiv

nanorepertoire:面向纳米抗体库分析的端到端 Nextflow 流程

该工作提出 nanorepertoire——一个专用于骆驼科 VHH 纳米抗体库的端到端 Nextflow DSL2 流程,将双端 AIRR-seq FASTQ 数据经质控、接头修剪、读段合并、计算机翻译、CD-HIT 克隆分型与 nanoCDR-X 深度学习 CDR3 注释,输出包含克隆结构、CDR3 长度与氨基酸组成、克隆内均一性、库多样性及运行碳足迹的交互式 HTML 报告,并在两个公开的 SARS-CoV-2 RBD 筛选羊驼文库(共 480 万双端读段)上于 16 vCPU 云实例 59 分钟内完成,回收 41,363 个不同 CDR3 抗原结合位点,重现了筛选后克隆多样性收缩的预期现象。
Heart & Lung

多模态大语言模型在院前心电图判断急诊导管室启动上的表现:一项回顾性对比分析

该研究对270例疑似急性心肌梗死患者的院前急救场景中采集的615份心电图进行回顾性分析,以心内科实际启动STEMI通路作为参考标准,比较三种多模态大语言模型与心电图机算法的判读表现,发现Gemini敏感度最高(95.3%)但特异度极低(9.4%),ChatGPT与Claude敏感度中等(68.1%与67.2%)且特异度有限(42.3%与46.5%),而心电图机算法敏感度67.7%、特异度64.2%,表现更为均衡,提示通用大语言模型在时间敏感的急诊流程中不适合用于基于心电图的导管室启动决策。
bioRxiv

语料库级因果关系:聚合基因-疾病因果证据的算法设计与应用

该工作提出一种通过整合基因调控网络中的网络因果信号(CWCS-Net)与基于新开发的Truth Discovery算法从PubMed摘要中提取的文献证据(CWCS-TD)来推断基因-疾病对语料库级因果评分(CWCS)的方法,并以OMIM为外部专家参考,在十种疾病上取得因果类别F1分数0.600,优于GPT-4o(0.505)和MMed-Llama 3(0.522)。
medRxiv

结核病三期试验中治疗结束结局与治愈后复发的时变可预测性

该研究利用两项三期试验共2918名参与者的统一临床数据,从基线到治疗结束按月训练表格数据模型,对治疗结束(EOT)结局和治愈后复发进行时变预测,发现EOT结局预测在第3个月后改善(ROC-AUC最高0.84,主要由痰涂片和固体培养驱动),而复发预测仅在第3个月内有小幅提升(ROC-AUC 0.58-0.63)随后下降,年龄、性别、临床症状和细菌负荷贡献最大;基于大语言模型嵌入的模型在复发预测上与表格模型相当,在第3和第4个月优于表格EOT模型(ΔROC-AUC 0.12和0.14),纵向建模和稀疏变量纳入仅在4-6个月改善复发预测(ΔROC-AUC 0.09、0.19和0.12)但可解释性降低;纳入
Pharmacology & therapeutics

癌症耐药:从单基因机制走向系统性适应性耐药的概念转变

这篇综述提出将多药耐药(MDR)从传统的单基因机制模型重新理解为一种复杂且不断演化的系统性适应性耐药现象,并系统梳理了经典耐药机制(药物摄取/外排、代偿性通路激活、凋亡逃逸)、非遗传性耐药机制(药物耐受持留细胞DTPs、上皮-间质转化EMT、癌症干细胞CSC可塑性及其相关因素)、这些机制之间的相互作用如何共同促成肿瘤持续存在与MDR演化,以及转化医学障碍与新兴药理策略(包括纵向分子监测和人工智能辅助的耐药预测)。
medRxiv

大语言模型真的在使用临床病例描述吗?一项针对骨科住院医师培训考试的问题消融研究

该研究对2020至2024年共792道骨科住院医师培训考试(OITE)题目(其中434道含临床图像、358道不含图像)进行问题成分消融,评估三个开源Ministral-3模型(3B、8B、14B)与五个专有模型(Claude Haiku-4.5、Sonnet-4.6、Opus-4.8、GPT-5.6 Luna、GPT-5.6 Terra),发现含图像题在完整信息下汇总准确率为59.13%(58.21-60.08),去掉图像后仍为59.13%(58.18-60.11),而去掉临床病例描述后降至49.05%(48.07-50.00);不含图像题从完整临床背景的72.94%(72.10-73.85)降至去
arXiv

面向耦合语义例程生成的LLM上下文动态适配

该工作提出“动态上下文适配”:一个由验证智能体从执行轨迹中提取结构化诊断反馈、生成智能体每轮提出多个候选、并以知识图谱提供语义约束、以模拟退火进行非贪心选择的验证—生成循环,用于缓解其称为“静态绑定”的LLM代码生成局限;在八个问题中,该方法在300与600次评估时于七个问题上优于零样本、Reflexion与OpenEvolve(p<0.01),在1000次评估时于主要动机问题(跨耦合优化)取得最佳分数(0.694 对 0.681,p=0.019,d=0.52),消融显示结构化执行反馈是主要驱动因素。
arXiv

GenFT:面向预训练基础模型的生成式参数高效微调方法

该工作提出 GenFT,一种以预训练权重 W0 为条件的参数高效微调方法,用确定性生成器对 W0 做行、列变换并配合共享-专属分解来生成任务专属更新 ΔW,在 GLUE(RoBERTaBase,平均 85.87%,0.24M 参数)、VTAB-1K(ViT-B/16,平均 74.50%,0.27M 参数)与 FGVC(平均 90.38%,0.29M 参数)上取得与代表性 PEFT 基线相当或更好的平均表现,并在 LLaMA-7B 的 Alpaca 子集上做了困惑度试点验证。
Journal of the European Meteorological Society.

机器学习正在重塑天气预报:下一步是工作方式的改变

这篇由Peter Dueben、Peter Bauer、Oliver Fuhrer、Nikolay Koldunov和Jørn Kristiansen撰写的文章指出,在机器学习已能产出与复杂传统系统预报技巧相当的天气预报之后,应把注意力从预报输出转向支撑预报系统的工作实践,并论证机器学习与近期数字技术将重塑预报价值链的各个环节——模型如何编码与开发、观测与地球系统数据如何被利用、数据与算力如何管理、系统如何被检验,以及信息如何被创造、评估并转化为服务;文章讨论了六个非穷尽的方向,其中智能体软件工程、开放与压缩数据、共享检验工作流、交互式计算和生成式方法可能使建模、评估与服务创建更快、更具交互性且更易获得
Journal of Medical Internet Research

创伤患者30天死亡风险的动态预测:混合神经网络模型的开发与评估

该研究利用丹麦首都大区2017至2024年间9496例创伤患者的电子健康记录,构建了一个融合表格数据与时间序列数据的混合神经网络模型,可在从院前到出院的任意时间点预测30天全因死亡风险,在包含1829例患者的留出集上取得AUROC 0.962、AUPRC 0.655,并在首次接触患者后1小时的活跃队列评估中取得AUROC 0.905,其判别能力优于修订创伤评分(平均ΔAUROC +0.297)和创伤与损伤严重度评分(平均ΔAUROC +0.169)。
Transfusion clinique et biologique : journal de la Societe francaise de transfusion sanguine

输血感染风险:十年回顾与展望

这篇综述回顾了2016至2026年间传染病对输血服务的影响,梳理了献血者筛选、检测与病原体减少技术方面的创新,盘点了寨卡病毒、疟原虫、巴贝虫和SARS-CoV-2等新发与再发病原体,并指出个体化风险评估、献血者延迟政策放宽以及人工智能与机器学习在监测和威胁预警中的应用等进展,同时强调这些改善在低收入和中等偏下收入国家尚未普及。
International Journal of Cardiology

AI辅助手持超声在住院床边心脏分诊中的前瞻性实施研究:OPTIMUST

OPTIMUST是一项前瞻性单中心实施研究,在心脏科与非心脏科病房由未取得正式超声心动图认证的医师完成两个月结构化培训后,使用Caption AI赋能的手持超声进行聚焦检查,287次尝试中206次(71.8%)图像可分析,操作者对左室射血分数的评估与专家对同一手持图像集的复核相关(r=0.84),充盈压分类的二次加权κ为0.659,93.7%的检查中医生报告手持超声结果改变或确认了处理方案,32.8%在一个月内接受了全面超声心动图检查。
medRxiv

用大语言模型从心导管报告中自动识别复杂经皮冠状动脉介入治疗

该研究在耶鲁纽黑文健康系统三家医院共1,412份心导管操作记录上,用人工标注作为参考标准,评估了三个开源大语言模型(Llama 3.3 70B、Meditron-7B、BioMistral-7B)识别经皮冠状动脉介入治疗(PCI)报告并抽取六项复杂PCI特征的能力,结果显示Llama 3.3 70B在多数任务上优于两个较小的医学领域模型,PCI识别达到100.0%敏感度、93.8%特异度、96.4%准确度和95.9% F1,复杂PCI分类在590份可评估报告中达到97.7%敏感度、80.1%特异度、57.6%阳性预测值、99.2%阴性预测值和83.9%准确度,且在明确记录的变量(如支架数量和支架长度)上
Clinical transplantation and research

人工智能在临床前非人灵长类异种移植中的应用:从数据复杂性到临床精准的桥梁

这篇综述综合了人工智能与机器学习在非人灵长类异种移植临床前研究中的应用证据,指出计算机视觉可支持连续无创的行为表型分析与疼痛评估、异常检测算法可从生物信号流中提取早期预警信号、多组学整合可识别异种移植物特异性生物标志物特征、数字孪生框架或可支持对潜在人类受者反应的假设生成式模拟、可解释人工智能可使模型输出更透明并更具监管可辩护性,并提出了一项研究议程,使人工智能增强的非人灵长类实验成为从临床前数据复杂性通向异种移植临床精准的桥梁,同时支持3R(替代、减少、优化)伦理要求。
发表出处待核验

当AI说“我也经历过类似的情况”:类同伴照护支持中的合成亲身经历

该研究以阿尔茨海默病及相关痴呆(ADRD)家庭照护者为情境,结合在线社区中的人类同伴支持对话与三个大语言模型(LLaMA、GPT-4o-mini、MedGemma)在“类同伴”提示下生成的回应,通过心理语言学分析与质性分析比较人类同伴与AI如何使用个人叙事,发现人类同伴回应中第一人称与过去时导向语言显著多于类同伴AI回应,并归纳出人类同伴支持中七类个人叙事,指出AI常能复现其中的情感工作却可能虚构经历依据,从而提出“叙事真实性差距”与“合成亲身经历悖论”。
arXiv

基于子图的3D蛋白质结构几何自监督预训练

本文提出一种新的3D图神经网络自监督预训练任务:在AlphaFold数据库中542k个SwissProt蛋白质结构上,预测蛋白质各子图(以10%氨基酸为中心的2-hop ego网络)的几何质心与整个蛋白质全局几何质心之间的欧氏距离(离散为10个等宽区间并以交叉熵分类),在ProNet、SchNet、GCN三种骨干与ca_base、ca_angles、ca_bb三种特征化方案下,于Fold、Superfamily、Family与React分类任务上相较无预训练与边距离预训练基线取得最高约6%的提升,且无需多视图、增强或掩码策略。
The Journal of Clinical Endocrinology & Metabolism

人工智能辅助放射报告分析:偶发甲状腺发现的流行病学与结局

该研究开发并部署了一套基于Transformer的自然语言处理流程,从2017年7月1日至2023年9月30日梅奥诊所各院区115683名无既往甲状腺疾病成人的甲状腺相关影像报告中识别偶发甲状腺发现,发现7.8%的患者存在此类发现(其中92.9%为结节性),且这些发现与后续甲状腺结节诊断、活检、甲状腺切除及甲状腺癌诊断的更高比值比相关,多数癌症为乳头状癌。
Trends in biotechnology

胶质母细胞瘤液体活检:新兴技术与转化机会

这篇综述聚焦胶质母细胞瘤的液体活检,指出组织活检具有侵入性且难以捕捉肿瘤异质性与时间动态,而液体活检可通过血浆、脑脊液、尿液和唾液中的游离DNA、循环肿瘤DNA、循环肿瘤细胞和细胞外囊泡等循环生物标志物实现无创实时监测,并提出超越既往生物标志物清单的量化技术评分卡,从灵敏度、临床可操作性、成本和可扩展性比较cfDNA、CTC和EV平台,同时引入多模态决策矩阵和人工智能驱动的融合流程,整合片段组学、EV蛋白质组学和CTC转录组学,以增强微小残留病灶检测并指导精准神经肿瘤学。
medRxiv

术前社会连接与成人术后结局:系统综述与荟萃分析

该研究系统检索并汇总了445项研究,发现术前社会连接较弱与术后早期死亡(OR 1.50,95% CI 1.12-2.01)和非家庭出院(OR 1.95,95% CI 1.35-2.81)相关,但与术后生存、非计划再入院和并发症的关联置信区间均包含1,总体证据确定性为低至极低。
arXiv

重新评估异质图学习的进展:三类异质数据集划分与同质性度量的定量评测

该工作对27个常用基准数据集上的基线模型进行超参数微调,依据图感知模型与其对应图无关模型的对比表现,将异质数据集划分为恶性、良性与模糊三类,并据此重新评估11个SOTA异质图模型、在三种合成图生成方法上对11个同质性度量做首次定量评测,发现多数SOTA模型并未显著优于最佳基线,且经典度量仍具竞争力。
Biochimie

利什曼原虫的MAPK信号网络:结构多样性、生物学功能与治疗潜力

这篇综述系统梳理了致病性利什曼原虫中15个MAPK同源物,将各成员与寄生虫分化、胞内存活、应激耐受、运动性、毒力及药物反应相关联,并区分了经实验验证的机制性靶点与计算预测的候选靶点,同时评估了小分子与天然产物抑制剂、药物重定位、结构导向策略以及分子动力学、AlphaFold建模、人工智能和纳米技术的应用,并指出MAPK10作为疫苗相关抗原的证据。
JMIR AI

先检索后验证:评估大语言模型生成医学信息的证据支持与幻觉

该研究对 GPT-5、OpenAI o3-mini 和 GPT-3.5 三个大语言模型在 97 项随机对照试验的 RoB 2 偏倚风险评估任务上进行评测,先用 Okapi BM25 从试验报告中检索相关段落,再对每条生成声明给出支持、矛盾、未找到或超出范围的证据判定并附原文引文,结果显示各模型二分类准确率高达 90%-98%,但证据支持率仅为 60%-65%,保守幻觉率为 34%-37%,说明决策层面的高准确率并不等于输出有文献依据。
Advanced science (Weinheim, Baden-Wurttemberg, Germany)

人工智能引导的表型药物重定位:针对肺炎链球菌的候选抗生素发现

该研究针对耐药性肺炎链球菌,利用由 transformer、图模型和树模型组成的集成模型(在 1849 个活性化合物与 34 503 个非活性化合物上训练),对 6747 种药物进行前瞻性筛选,选出 11 个候选抗生素,其中 9 个在体外显著抑制肺炎链球菌 R6 生长(IC50 ≤ 0.4 µg/mL),最强效的硫链丝菌素和头孢噻呋 IC50 分别为 0.0001 µg/mL(60.1 pM)和 0.0004 µg/mL(764 pM),且硫链丝菌素对多重耐药菌株仍保持高效力。
Structure (London, England : 1993)

AlphaBridge:预测生物分子复合物的分析工具

该工作提出 AlphaBridge,一个结合 AlphaFold3 置信度指标、可对参与二元相互作用的序列基序及其在复合物三维界面中的分布进行聚类,并通过弦图、网络图和汇总表可视化置信范围内的相互作用界面、同时提供网页服务器版本的可复现自动化工具包,作者用二元与多组分蛋白复合物对其评分能力进行了验证并讨论了实际使用案例。
The Permanente journal

人工智能能否在真实医疗系统中落地?AIM-HI 五个资助项目的早期洞察

该文总结了由 Kaiser Permanente 牵头、Gordon and Betty Moore Foundation 资助的“医学与医疗保健增强智能计划”(AIM-HI)通过全国多阶段结构化评分评审选出的 5 个资助项目(分别涉及脓毒症管理、静脉血栓栓塞风险评估、糖尿病视网膜病变筛查、心脏淀粉样变性检测和儿童哮喘风险预测)的跨项目早期经验,指出在多样化临床环境中真实世界 AI 部署是可行的,但常见挑战包括电子健康记录整合、数据复杂性、监管要求与临床工作流程差异,而成功关键在于将工具审慎整合进临床环境、与利益相关方建立牢固伙伴关系,以及持续评估与监测。
medRxiv

基因组基础模型衍生的扰动谱将体细胞突变与癌症生物学及临床结局联系起来

该研究使用 AlphaGenome 与 AlphaMissense 对来自癌症基因组图谱(TCGA)8,800 名患者、33 种癌症类型的体细胞突变进行扰动量化,发现复发性热点突变在蛋白层面预测效应更强,而非热点突变在多数癌症类型中调控效应更大;将变异层面预测聚合为患者-基因扰动谱后,这些谱具有基因与模态特异性,反映组织来源、癌症类型与微卫星不稳定性状态,并保留超出肿瘤突变负荷的信息;在缺乏复发性热点突变的患者中,更高的预测扰动与总生存相关,其中染色质可及性信号最强且最一致,在独立治疗注释队列中基因层面扰动也与治疗定义亚组内的生存相关。
Practical radiation oncology

人工智能驱动的一键式功能性肺避让放疗自动计划系统的临床实施与评估

该研究将整合了基于剂量学评分的射束角度选择、多模态引导剂量预测与功能引导剂量模拟的AP-FLART系统在RayStation中实施,并用33例接受SPECT通气或灌注成像的肺癌患者数据评估,结果显示自动FLART计划较手动常规放疗计划显著降低高功能肺平均剂量15.1%,在FLART获益患者中把≥2级放射性肺炎概率降低6.25个百分点(27%),临床收益与手动FLART计划相近,且87.9%的自动计划无需修改即可被临床接受,计划时间从2-3小时缩短至约8分钟。
Journal of Nondestructive Evaluation

混凝土中的慢动力学:温度、强度差异与微裂纹损伤的影响

本研究用压缩加载对四种抗压强度(f′c=32~56 MPa)的混凝土棱柱及两个碱-硅反应(ASR)损伤试件进行调理,以尾波干涉(CWI)监测随后的波速恢复,并采用自参考温度修正消除约±0.2°C环境温度波动引起的漂移;结果显示完好试件的恢复速率mv与波速降幅|c|随强度增大(|c|由3.08×10⁻⁴升至6.02×10⁻⁴,mv由6.77×10⁻⁵/s升至13.76×10⁻⁵/s),恢复时间由9.9 h缩短至6.6 h,而ASR损伤试件在同一应力下软化更大、恢复速率更快但恢复时间显著延长(最长458 h),表明慢动力学参数对完好混凝土强度与损伤微裂纹均具敏感性。
Research Square

LLM 用于开放式调查文本分析:人类与 GPT-5 在归纳式内容分析上的表现比较

本研究以欧洲博士生调查中六个开放题、共 903 条回答为材料,让五名人类编码者与 GPT-5.4 按同一套归纳式内容分析流程分别生成编码与主题,用调整兰德指数(ARI)衡量一致性,结果显示人机在编码层面的平均一致性为 0.61、主题层面为 0.54,接近人类内部(0.68)与模型内部(0.76)的一致性水平,且各变量间一致性差异较大,低内部一致性总伴随低跨主体一致性。
RNA

基于连续介质的反应扩散模型揭示染色体失活中基因沉默的空间传播机制

本文建立了一个基于连续介质的反应扩散模型,用以刻画XIST介导的基因沉默在染色体上的传播,发现XIST的扩散可由调控其合成与降解的已知负反馈环路调节,而基因沉默的传播则由沉默复合物的全局调控与局部表观遗传调控因子共同驱动的波钉扎机制所控制,并结合由实验数据推断的三维染色体结构展示了沉默传播的时空调控。
npj Digital Medicine

用LLM配对比较审计急诊分诊中的性别差异

该研究提出一种领域无关的配对比较方法,先微调大语言模型复现急诊分诊记录中的决策,再对仅翻转性别、其余临床内容保持不变的配对样本进行预测比较,在法国波尔多大学医院逾14万例就诊记录中发现女性版本比男性版本更易获得较低严重度(较不紧急)的预测分诊等级,合并每对差异率约1.1%(95% CI 0.9–1.3),并在MIMIC-IV上复现出方向一致但更大的约2.2%(1.7–2.7)差异,同时通过性别中性化重训模型使性别间预测差距消失,表明该不对称由显式性别标记介导。
Anesthesiology

多中心数据驱动的多模态人工智能危重症患者死亡预测模型:开发与外部验证

该研究利用MIMIC-III、MIMIC-IV、eICU与HiRID四个公开重症监护数据库共203,434例ICU入院记录(2001至2022年,覆盖200余家医院),开发并外部验证了一个多模态深度学习模型,仅使用ICU入科后首个24小时内可获得的时间不变变量、时间序列变量、临床文本记录与胸部X线图像,预测此后住院死亡风险;仅用结构化数据时模型AUROC为0.92(95% CI 0.90至0.93)、AUPRC为0.53(95% CI 0.49至0.57)、Brier分数为0.19(95% CI 0.18至0.20),在eICU八个机构外部验证AUROC为0.84至0.92,而在同时具备临床记录与影像的患
medRxiv

肿瘤区域识别引导评分(TRIGS)与基于基础模型的肿瘤浸润淋巴细胞评分在三阴性乳腺癌PARTNER随机对照试验中对病理完全缓解/无事件生存的预后价值

该研究更新了自动化肿瘤浸润淋巴细胞(TIL)评估流程,提出对齐临床评分指南的TRIGS与基于基础模型的SAM-TIL,并在TransNEO队列166例新辅助治疗患者中显示二者预测病理完全缓解的比值比分别为1.95(95%置信区间1.22-3.03,p=0.005)和2.32(95%置信区间1.43-3.77,p=0.001),在癌症基因组图谱277例三阴性与HER2阳性患者中总生存风险比分别为0.79(95%置信区间0.63-1.00,p=0.05)和0.80(95%置信区间0.67-0.97,p=0.02),与金标准临床评估的相关性为0.59-0.69,且在预测病理完全缓解(AUC 0.60-
The latest research from Google

Retrieve-for-Train:用离线强化学习编译查询扇出,以扩散检索器绕过推理延迟瓶颈

该工作提出 Retrieve-for-Train 框架,先用离线强化学习训练一个扇出语言模型(基于 Gemma3-4B 与 Qwen3-4B,每次生成 10 个子查询),以 groundedness、Vendi Score 多样性、对齐度三项复合奖励评估整组结果,再把该行为蒸馏进一个 53.9M 参数的扩散检索器,使其在连续嵌入空间中一次非自回归并行生成完整目标集合,从而在开放式抽象检索与弱监督组合检索两类任务上超过单查询检索、零样本扩展与 Best-of-N 基线,并相对自回归方法取得 12 至 20 倍加速。
Nature News

把论文变成可对话的智能体:Paper2Agent 的报道解读

据《自然》新闻报道,Paper2Agent 可读取一篇论文的正文、代码与数据集,将其放入 MCP 服务器,并由一组 AI 智能体自动构建能对该论文方法加以应用的工具,从而生成一个可用自然语言对话的“虚拟通讯作者”;报道称其在约 45 分钟内、以 14 美元算力成本为 AlphaGenome 论文生成智能体,该智能体在遗传学问题上接近满分,并优于包括 Biomni 在内的其他生物医学 AI 智能体,还被用于重新评估某个与“坏”胆固醇相关的 DNA 单字母变异所指向的因果基因,得出与原始论文不同的候选基因。
Nature News

人脑组织移植入小鼠:迄今最广泛整合的脑区嵌合模型

该研究通过基因工程使小鼠大脑皮层前体细胞不能存活、从而腾出脑腔空间,再将人脑组织植入新生小鼠,结果显示移植组织在两到三个月内扩张近五倍、填充超过90%的空腔并向小鼠脊髓深部发出投射,同时发育出包括类似von Economo神经元在内的特化神经元,而行为测试未显示小鼠智力增强。
Nature News

阿斯加德古菌培养与病毒-宿主系统:为真核起源提供活体线索

该证据包以一篇Nature新闻特写与两篇bioRxiv预印本,报道了阿斯加德古菌(Promethearchaeota)培养进展:活细胞显微显示Loki与Hodarchaea谱系细胞在分钟尺度上剧烈改变形态、以1.5至5.3微米/分钟伸缩突起并在玻璃表面爬行,且肌动蛋白抑制剂可阻断这些动态;同时首次培养出感染Ca. Lokiarchaeum ossiferum B36新菌株的阿斯加德古菌病毒,其16 kbp整合型原病毒可切出并独立复制形成病毒颗粒,被归入新科Fylgjaviridae,宿主携带Septu、Wadjet与II型CBASS等抗病毒防御系统。
Nature News

脑内“微蛋白”图谱为阿尔茨海默病研究提供新线索

该研究结合质谱、RNA测序与核糖体图谱分析608份阿尔茨海默病患者与非患者的死后背外侧前额叶皮层样本,鉴定出4,321种微蛋白(其中3,217种未见于UniProtKB/Swiss-Prot标准人类蛋白目录),并用深度学习模型对3,001种微蛋白的质谱鉴定置信度排序,其中1,067种获高置信度评级,同时发现数十种微蛋白在阿尔茨海默病患者中表达改变,构建了迄今规模最大的阿尔茨海默病微蛋白图谱并公开数据。