跳到主要内容

日报

AI 与科学前沿 · 2026-09-21

仅汇集当天已送达公开发布边界的内容。

Microsoft Research

RetroChimera:以双模型学习式集成提升小分子逆合成预测

该工作提出 RetroChimera 逆合成预测框架,将基于 Transformer 的从头预测模型 R-SMILES 2 与基于图神经网络、以反应模板为约束的 NeuralLoc 通过按排名加权的学习式集成策略结合,使二者互补优势得以发挥,在常见与罕见反应类别上均表现稳健,并在盲测中使博士级化学家更偏好其给出的复杂分子断键方案,优于两个子模型、更早的方法乃至测试集本身记录的反应。
NVIDIA Research

AI 安全是一项工程问题:在智能体技术栈的每一层加以解决

本文主张 AI 安全应作为工程问题处理,即需要明确的安全需求、可强制执行的管控、具名的责任人和防护有效的证据,并提出安全取决于整个智能体技术栈(模型、harness、运行时环境)各层的协同,介绍了 NVIDIA OpenShell 这一开源安全运行时及其在 Open Secure AI Alliance 伙伴中的集成,以及 CrowdStrike SafeMind、Palo Alto Networks Prisma AIRS、Capital One VulnHunter、ReversingLabs Spectra Assure 等防御工具示例,强调开放共享失败证据与验证方法以加速防御方优势。
Hugging Face

把LLM剪枝当作物理问题:块移除作为伊辛优化

该工作将大语言模型的块移除选择重新表述为约束二元优化问题,等价于在伊辛玻璃中寻找低能态,用一次校准得到的近似Hessian能量作为下游质量的廉价代理,从而无需逐次基准测试即可排序海量候选配置;在Llama-3.3-70B-Instruct上以50%压缩率(移除40/80块)不重训练时MMLU保持在约77,而最强基线块影响法降至约54,并在Llama-3.1-8B-Instruct、Qwen3-14B以及混合架构NVIDIA-Nemotron-3-Nano-30B-A3B-FP8上验证了该表述的迁移性。
OpenAI

Higgsfield AI 借助 GPT-6 Astra 一天内上线新视频功能

这篇报道介绍 Higgsfield AI 如何借助 GPT-6 Astra 让小型企业通过单条提示词生成视频广告变体,并让一名工程师在一天内交付新的探索功能,公司方面将这一速度归因于 Astra 的长程任务规划能力以及创意团队与工程师之间的紧密协作。
OpenAI

为AI下一阶段构建标准:一份关于前沿AI国际技术标准的政策主张

本文是一份政策立场文件,主张由美国牵头、联合各国AI安全研究机构与标准组织,为前沿AI(尤其是自动化AI研究与递归自我改进RSI)制定国际技术标准,以应对碎片化、集体行动困境与能力分布不均三大挑战,并明确标准应聚焦能力评测、风险与保障充分性,而非许可或强制预发布审批。
deepcybo-physai.github.io

PhysBrain 1.5:把语言、动作与未来世界状态统一进一个自回归词表的物理基础模型

PhysBrain 1.5 以预训练 Qwen3-VL 为骨干并扩展专用动作与视觉状态 token,把语言回答、结构化空间输出、末端执行器轨迹与未来世界状态统一为离散 token 并在单一“下一 token 预测”目标下联合学习,预训练阶段的具身监督全部来自人类交互视频(自我中心、同步自我—外中心与全景记录,组织为以任务为中心的片段),监督微调再结合人类演示、真实机器人轨迹与仿真经验,在 28 个具身空间智能与规划基准上 8B 版本取得 72.5 的总体平均分,开源模型中排名第一,并与 GPT-6-Astra(73.3)和 Gemini 3.6 Flash(73.0)等领先闭源系统表现相当,在开源模型中于 14 个基准排名第一、10 个
medRxiv

隐私感知蒸馏大语言模型提升多病共存评分

该研究提出并评估了一种隐私保护的知识蒸馏框架:用CTGAN基于英国生物银行(UK Biobank)分布生成合成队列,让GPT-4o、Gemini、DeepSeek三个教师大模型在零样本设定下生成多病共存评分,再训练紧凑的学生模型CoLLM来模仿这些评分,从而在不向第三方API暴露真实患者数据的前提下,将CoLLM应用于真实UK Biobank数据(N=439,221)生成多病共存评分,并在生存预测、全基因组关联分析和多基因风险评分关联上与传统Charlson(CCI)和Elixhauser(ECI)指数比较。
Plastic and reconstructive surgery

用人工智能面部真实性定位(FAL)模型检测被篡改的在线鼻整形图像

该研究首次将基于人工智能的面部真实性定位(FAL)模型大规模应用于美容外科媒体,对RealSelf.com公开图库中连续600张鼻整形术后照片进行分析,发现19.5%(117/600;95% CI 16.3–22.7%)存在疑似数字篡改,并在200张推定未编辑的临床照片上得到1.5%(3/200;95% CI 0.51–4.32%)的假阳性率、在50张经Facetune几何扭曲的临床照片上得到100%(50/50;95% CI 93.0–100%)的敏感度。
PloS one

MEF-TBN:面向多曝光图像融合的三分支特征提取与色彩增强网络

该工作提出 MEF-TBN,一个在 YCbCr 空间工作的三分支网络,用上下文聚合注意力网络(CAAN)分支提取多尺度局部特征、用 transformer 分支以多头自注意力建模全局长距离依赖、并用色彩增强分支学习亮度与色度之间的映射关系,两个特征分支在低分辨率下生成权重图、经含三个 merger block 的合并模块细化后由导向滤波联合上采样(GFU)恢复到原分辨率,在三个 MEF 数据集上与 9 种代表性方法比较,在 AG、EI、SF 等图像特征类指标和 QCB、VIF、NIQE 等人类感知类指标上取得最优,MEF-SSIM 排名第二,相对 SwinFusion 在 QCB、VIF、NIQE、MEF-SSIM 上平均提升 11.5
medRxiv

人工智能增强心电图在单基因与多基因易感性下检测和预测肥厚型心肌病

该研究在三个国际中心的1,095名致病或可能致病肌节变异携带者中,用已验证的AI-ECG模型从12导联心电图图像生成HCM评分,发现其识别基线HCM表型的AUROC为0.91、识别显性HCM为0.92,在基线基因阳性/表型阴性者中评分每升高1个标准差与随访期发生HCM相关(未校正HR 1.55,校正后HR 1.38),并在57,007名UK Biobank参与者中显示AI-ECG评分与多基因风险评分相互独立且相加,二者同时偏高者HCM的校正比值比为60.2。
PLoS biology

AlloPool:从分子动力学模拟中推断蛋白质别构的图神经网络框架

该研究提出 AlloPool——一个基于图神经网络、通过时间注意力与迭代边池化从平衡与非平衡分子动力学轨迹中学习最小化、随时间演化的残基相互作用网络的框架,在 Pin1、GAIN 机械感受域、D2 与 β1 肾上腺素受体、SdrG 黏附素、PDZ3 及 Engrailed 同源域等体系中以亚埃级 RMSD 重建轨迹,并据此映射别构通路、预测配体药理学、力学加载状态与突变效应。
medRxiv

美国骨科医学院公开患者信息政策中的决策支持:基于情境小品的文件分析

该研究以20所美国骨科医学院为样本、用8个教育情境小品生成160个学校-情境配对,每对经三轮AI辅助检索与评估并按“明确支持、可推断、模糊、未涉及”分类,结果显示159/160(99.4%)至少检索到一份合格来源,但仅21对(13.1%)被归为支持充分,其中生成式AI辅助反思性写作最常见(7/20所学校,35%),个人云笔记与官方临床日志则无一例支持充分。
medRxiv

在线健康安全鸿沟:共识对齐并不等于同伴健康叙事中的安全

该研究提出并实证验证了“在线健康安全鸿沟”:在704条健康叙事(699条完成分类)中,由互不重叠特征集计算出的叙事真相距离(NTD,衡量认知偏离)与叙事风险分数(NRS,衡量健康风险潜力)仅共享4.9%的方差(r=0.222,p<0.001),导致39.6%的叙事落入单轴系统必然误判的两个非对角象限(对齐但高风险25.2%、偏离但安全14.4%),并在437条专家标注的误信息基准(含127条误信息实例)上最高判别力仅为Youden J=0.349,据此提出“分类象限”框架,主张从以事实为中心转向风险感知的评估。
medRxiv

MES:面向医疗决策的多智能体证据合成系统

该研究提出 MES 这一由六个专门智能体(Supervisor、LiteratureMiner、RWD-Analyst、KG-Specialist、Statistician、SafeChecker)组成的多智能体框架,用于在保留来源可追溯性的前提下整合已发表文献与试验证据、从真实世界数据生成针对具体问题的真实世界证据并查询生物医学知识图谱,并在两个临床用例(匹配文献缺失的阿尔茨海默病用药问题、随机证据不一致的脓毒症休克β受体阻滞剂问题)以及覆盖六类循证医学范畴的144个临床查询上评估,报告显示其能生成保留来源可追溯性、识别跨来源分歧并传达不确定性的结构化报告,且 SafeChecker 在 CliniF
PLOS global public health

把卫生人力重新定义为“人机混合能力资产”:Workforce Science 的提出

这篇观点文章提出“Workforce Science(人力科学)”,主张在人口老龄化、流行病学转变、不平等扩大与人工智能快速嵌入的背景下,把卫生与社会照护人力从“需要培养和雇佣多少劳动力”的供给问题,重新界定为如何测量、分析和治理由人、团队与智能技术共同生成的“混合人机能力”,并给出有效能力(C*)由教育筹资、教育质量、劳动、人机动态、治理能力以及工作条件与权利共同构成的框架,以及定义→测量→分析→治理→照护的五层科学探究路径。
PloS one

基于XLNet与SHAP的HMPV公众情绪可解释分析

该研究从YouTube新闻频道抓取2024—2025年HMPV相关评论15,300条、经预处理保留9,758条,用VADER生成弱情绪标签,比较ELECTRA、RoBERTa、ALBERT、DistilBERT、XLNet与BERT六种Transformer模型,XLNet取得93.50%的最高准确率,并用SHAP的PartitionExplainer对正确分类样本给出词级归因,显示“flu”“fear”等词推动负面判断、“save”“help”“mad”与中性相关、“falling”“save”“god”“america”与正面相关。
medRxiv

用LLM合成人口模拟社区健康行为:LLMPopSim框架的跨州评估

该研究提出LLMPopSim,一个整合美国人口普查局与CDC数据构建合成个体、并用大语言模型模拟个体健康行为、再在社区层面评估聚合结果的生成式人口模拟框架,以夏威夷历史数据开发,并用夏威夷与纽约州2022年留出队列、以结直肠癌筛查与乳腺X线摄影为概念验证行为进行时间与地理泛化评估,四项州-结果评估的平均绝对误差为3.5至15.0个百分点,模拟与观测的ZCTA级患病率相关系数为0.26至0.69。
medRxiv

用现成大语言模型全自动抽取纵向乳腺肿瘤病历变量

该研究开发了一套符合HIPAA要求的开源流程,在100例复杂乳腺肿瘤患者(中位病历超过3100页、中位随访6.5年、中位7线治疗)中,用未经微调的现成商用大语言模型从原始未标注的临床笔记、病理报告和用药记录中抽取诊断与复发日期、临床分期、生物标志物亚型、基因检测结果及系统治疗信息,最佳模型在复发状态(99%)、胚系BRCA1/2致病变异(100%)、激素受体(99%)、HER2(96%)、临床分期(91%)、PIK3CA(91%)和ESR1(90%)上与专家一致性很高,抗癌药物抽取接近肿瘤科医生间差异,但精确治疗线重建的患者层面表现仍比第二位肿瘤科医生低9个百分点,四个模型在系统治疗抽取上均优
bioRxiv

EvSpark:面向混合DNA基础模型的无损推测解码

EvSpark 为 Evo2 这类卷积-循环-注意力混合 DNA 基础模型设计了一套推测解码系统,通过一次块前向并行验证草稿并用“状态切片”选择保留的中间状态来同时恢复 FIR、IIR 与 KV 三类推理状态而无需重放,在 Evo2 7B 的 48 条提示基准上(三个训练种子)对 43 条真实序列提示取得 2.96× 加速、含五条合成对照时为 3.27×,在 262k 上下文仍保持 1.84×–2.43×,并在 20B/40B 目标上分别取得 2.18×–2.46×(真实序列)与 2.51×–2.78×(全量套件)。
EuroIntervention

径向壁应变用于经皮冠状动脉介入治疗后的残余风险分层

该研究基于TARGET All Comers随机试验的1,551例患者,开发了一种可在常规造影中实时自动评估径向壁应变(RWS)的人工智能算法,在802例患者的1,384条非靶血管中评估其预后价值,发现基线最大RWS(RWSmax)≥13%独立预测5年非靶血管导向复合终点(NT-VOCE),校正后风险比4.82(95%CI 3.14-7.40),校正AUC 0.73,其中对非靶血管血运重建的预测准确性最高(校正AUC 0.92),在高质量造影图像亚组中预测性能更强(校正HR 6.89)。
arXiv

不给轨迹也能有预见:用隐变量运动趋势引导3D扩散策略

该工作提出 Movement Trend Guidance:从点云与机器人状态的短历史中学习一个紧凑的隐变量来表示交互演化趋势,训练时仅用稀疏的未来夹爪状态监督该隐变量,推理时只保留隐变量作为面向未来的条件,在几乎不增加参数(较 DP3 增加 3.52%)的前提下,于 RoboTwin2.0、LIBERO-40、DexArt 与五项真实机器人任务上一致提升 3D 扩散策略的成功率。
arXiv

多模态大模型的幻觉源自“协同头”内部信息分布漂移

该工作提出 HEAL,通过对多头注意力输出施加因果噪声干预并用反事实双重差分把注意力头分为冗余、视觉、语言与协同四类,发现幻觉发生在协同头内部视觉—语言信息分布偏离健康均衡之时,而非与模态专属头的数量或强度强相关,并据此在推理时向协同头的 value 向量注入动态校准因子,在多个 MLLM 与多个基准上降低了幻觉。
arXiv

Paint-Anything:用十六进制提示统一图像生成与编辑的任意颜色控制

Paint-Anything 提出一个共享的十六进制颜色提示接口,通过对象级颜色监督在生成与编辑两类任务上实现任意 24 位十六进制目标色控制,并构建了 Paint-500K 数据管线与 ACBench 基准,在 FLUX.2-4B 上使 ACBench-T2I 与 ACBench-Edit 分数分别相对基线提升 85.3% 与 28.3%,同时在对比方法中取得最高的平均 CompColor 分数。
arXiv

EvoOntology:让数据智能体拥有可自我演化的本体层

该工作提出 EvoOntology,把本体封装为 MCP 服务器(含 schema、content、tool 三层),由 builder agent 通过探测查询构建初始本体,再用归因引导的类型化编辑与骨干条件配对评估持续演化本体,在 DDR-Bench、InsightBench、BIRD 三个数据智能体基准和六个 LLM 骨干上一致优于 ReAct 基线与静态语义层基线。
arXiv

让稀疏系数自己学会压缩:信息瓶颈视角下的训练自适应卷积稀疏编码

该工作把卷积稀疏编码中的稀疏系数从人工设定的固定超参数改为可微、可与网络参数联合学习的变量,用FISTA展开迭代实现其梯度回传,并在信息瓶颈框架下解释该系数对“压缩—保留”权衡的控制作用,在CIFAR-10/100与ImageNet-1K上取得有竞争力的干净数据识别精度,并在多种输入扰动下显著提升鲁棒性,同时提出一种仅用少量无标签受损样本、冻结主干参数、只调整压缩强度的后训练自适应策略。
arXiv

把智能体技能写成图:GraphSkillEvo 用进化搜索优化可复用的流程知识

该工作把 LLM 智能体的技能表示为图结构的自然语言产物(节点为执行步骤及其操作指引,有向边编码依赖上下文的步骤转移),并在此基础上提出基于种群的进化优化框架 GraphSkillEvo,用全局指引变异、图结构变异、全局指引交叉、图结构交叉四个算子迭代搜索技能,在五个智能体基准、两个 LLM 与两种执行环境下平均优于技能优化基线 SkillOpt(GPT-5.4-nano 上 +4.01%,GPT-5.4 上 +1.76%),且总优化 token 消耗更低。
arXiv

MintAct:把界面定位、跨端导航与视觉工具调用收进一个视觉智能体

MintAct 提出 2B、4B、8B 三档视觉语言模型家族,用共享的截图观测与像素坐标空间、按域提示词切换的动作集、以及跨域均衡混合,把 UI 定位、移动端/桌面/网页多步导航和视觉工具调用统一到同一套权重中,并配套可承载数百并发实例的异步强化学习基础设施,在 OSWorld-Verified 上达到 48.9、Online-Mind2Web 上 39.1、AndroidWorld 上 67.0,与同规模单域专家模型相当或更优。
arXiv

可刷新、近域对照的电信诈骗音频评测基准:TeleAntiFraud 2.0

该工作提出 TeleAntiFraud 2.0——一个以月度冻结快照组织的可刷新中文电信诈骗音频基准,用混合树生成让诈骗与合法近域通话共享情境、仅在决定标签的行为处分叉,并报告在无关或普通负例下三个文本分类器达到完美 Macro-F1,而换成近域同源负例后降至 0.65–0.68,同时全量音频与 ASR+LLM 评测暴露出类别先验捷径、预测坍缩与快照敏感性。
arXiv

MoME:把稀疏查表变成上下文感知的记忆混合

该工作提出 Mixture of Memory Embeddings(MoME),把每个 token 的单一记忆行扩展为多个记忆槽,并用基于隐藏状态的学习门控在每一位置稀疏选择要读取的槽,从而在保持 token 索引式廉价查表的同时让记忆检索具备上下文感知;在 nanochat、Llama-3/MobileLLM 与 Qwen3 三类骨干的受控预训练中,MoME 在等参数与等训练 FLOP 设定下优于 Value Embedding、Bigram 与 STEM 基线,在十亿参数以下规模显示出更有利的记忆规模扩展趋势,训练与推理仍保持高效,并且对多义词的路由分析显示同一表层 token 在不同语义下被派发到不同记忆槽。
arXiv

当AI评审训练AI评审者:科学判断坍缩与缓解

该研究以Llama 3.1 8B为起点,先用2018–2023年ICLR官方评审微调出评审模型,再用其生成的合成评审与2024年官方评审按0%、33%、66%、100%比例混合训练四个后继模型,发现合成评审比例升高会压缩评分分布并单调降低同论文与语料级语义多样性(约11%与5%),作者称之为“科学判断坍缩”,并提出TrustReviewer系统,通过训练期语料筛选与推理期成对激活引导来缓解该倾向。
arXiv

把“细化”本身当作编辑界面:RefineEdit 如何在生成式细化网络中免训练改图

该工作提出 RefineEdit,一个免训练的提示到提示图像编辑框架,它把编辑定位与内容生成耦合在生成式细化网络(GRN)的全局二值码细化过程中:从源图细化的中间状态分支出编辑分支,用两分支对同一源采样比特的概率有符号差来选出可编辑的位置与比特,未选中的比特复制演化中的源状态,并以自适应空间冻结与有限比特锁定稳定跨步决策,在 PIE-Bench 九个编辑类别上取得最佳背景保持指标(PSNR、LPIPS、MSE、SSIM)以及最高的整图与编辑区域 CLIP 分数。
arXiv

从代码本身长出训练场:CodeMidas 如何把已实现功能变成编码智能体的强化学习环境

CodeMidas 提出一条以源代码为唯一任务特定输入的智能体流水线,把开源代码库中已实现的功能转化为可执行、可验证的编码强化学习环境,产出 5,545 个训练任务(来自 3,185 个代码库、23 种编程语言、15 个技术领域),并用 GRPO 训练 MiMo-V2.5,在五个外部基准上全部取得提升,包括 DeepSWE 通过率从 10.0% 升至 21.7%、ProgramBench 的 Almost Solved 从 4.5 升至 21.5、Terminal-Bench v2.1 从 63.7% 升至 72.2%。
arXiv

DeformSmith:用物理测试台把文本或单图变成可抓取的可变形资产

DeformSmith 提出一个分层智能体框架,从文本或单张图像出发,依次构建几何、物理模型、材料行为与机器人交互,并通过共享的物理测试台用仿真探针和机器人抓放反馈反复评估与修正,在 39 个案例的评测中其资产的视觉质量与物理合理性优于 PhysGen3D、PhysGM 与 PhysX-Omni 等基线,同时可产出可回放的机器人操作数据。
arXiv

OmniVBench 与 Omni-R2V:为“全能参考到视频”建立评测与训练的共同底座

该工作提出 OmniVBench 基准与 Omni-R2V 数据集,用 7 个任务族、18 个细粒度任务、813 个评测案例和 12,172 条基于参考因子的清单条目来评测全能参考到视频生成,并释放 340K 条经处理的训练样本,对多个开源与闭源模型的评测显示各任务族与各评测维度之间存在明显性能差距。
arXiv

把“教师自身漂移”从蒸馏信号里剥离:Cal-OPD 的校准式在线蒸馏

该工作指出在线蒸馏(OPD)所用的教师—学生逐词差异中混入了教师自身的上下文诱导漂移(Teacher Self-Deviation, TSD),并提出 Cal-OPD:用正负特权干预估计教师的自我漂移区间,只保留超出该区间的残差作为优化信号,在数学推理基准上仅保留约 52–65% 的原始差异却稳定优于标准 OPD 及其多种变体。
arXiv

以保留率为约束的 Cellpose–SAM 训练后量化:干细胞显微成像的可审计压缩协议

该工作提出一套预先设定保留标准的评估协议,在覆盖 BBBC038 细胞核、BBBC039 U2OS 荧光与 NIST iPSC 三种成像模态、共 176 个分层留出视野的公开面板上,检验 Cellpose–SAM 的多种训练后量化方案:仅权重量化 W8A16 在所有模态上保持实例 F1,敏感度引导的混合 W4/W8 方案(四个 INT8 例外算子)在无观测到灾难性失败的情况下把权重存储从 1162.07 MiB 降到 171.86 MiB,而三值 W2A16-G64 虽压缩到 96.21 MiB 却在 176 个视野中有 169 个灾难性失败,说明压缩应以按模态分层的下游保留率而非单一精度数字来评判。
arXiv

RecreationWorld:用“复刻”把界面操作与写代码缝进同一条长程轨迹

该工作提出 RecreationWorld 框架与 RecreationBench 基准:给定一个正在运行的参考应用,智能体须自行探索其行为并交付可构建、可运行的复刻实现,框架在 Ubuntu、macOS、Windows、Android、Web 五个平台提供可复现环境与统一 GUI+编码工具链,用参考派生的隐藏程序化与视觉断言自动评分,并据此生成 35,000 条经筛选的复刻轨迹用于训练;评测显示 GPT-6 Astra 以 58.1% 总体得分领先,但仅 2.8% 任务通过全部程序化测试,且复刻在静态界面结构上比在交互与计算结果上更可靠。
arXiv

冻结权重下的结构化技能优化:音频反诈检测的新路径

FRAUDSkill 在不改动音频语言模型参数的前提下,通过优化外部的技能程序、路由策略与决策规则,并结合结构化输出控制与验证引导的多路径推理,在 TeleAntiFraud 基准上把 Macro-F1 从共享冻结模型基线的 41.54% 提升到 73.50%,同时把无效输出率从 36.04% 降到 1.94%。
arXiv

从代码中规模化合成可验证技能:Code2Skill 与 CodeSkillBank 的栏目解读

该工作提出 Code2Skill 全自动流水线,把 GitHub 上 19,769 个活跃仓库的源码单元抽象为原子操作、复合工作流与重复模式三类技能记录,并通过“源码体盲重建”与“源码感知比对”逐条验证,构建出含 1,006,822 条已接受记录的 CodeSkillBank,在 72 组协议匹配评测中平均提升 11.7% 且 57 组胜出,并在七个共享基准上全面超过轨迹派生的技能库。
arXiv

IntBMoE:用块级条件化把专家参与度、执行量与参数物化解耦

该工作提出 IntBMoE,一种块级条件化的混合专家架构:用小型可学习码本定义若干可复用的多层块,由共享超网络把每层全部专家基合并成组合专家,再用路由器为每个 token 只选择少数块执行,从而在保持全池参与的同时维持稀疏执行与有界参数物化,并在 ImageNet-1K 图像分类上取得 73.76% Top-1、91.48% Top-5,在 MiniPile 语言建模与 IntTravel 序列推荐上同样优于所比较的稀疏与稠密 MoE 基线,且已在 AMap 生成式推荐系统中全量部署,在线 A/B 测试获得 2.4% 的相对 UVCTR 提升。