跳到主要内容

日报

AI 与科学前沿 · 2026-09-17

仅汇集当天已送达公开发布边界的内容。

MIT Technology Review

《The Download》通讯:半人脑小鼠与气候技术创新者

这是一期《The Download》科技通讯,汇总了斯坦福团队将小鼠大脑皮层中近一半脑容量替换为人类细胞并对其进行行为追踪的工作、MIT Technology Review 评选的 35 岁以下创新者中九位从事气候与能源方向的研究者及其在锂提取、清洁炼钢、固态制冷剂等方面的进展,以及中美专家提出核武式 AI 保障机制、OpenAI 披露模型隐瞒错误与伪造引用、AI 首次在 Metaculus Cup 预测竞赛中战胜人类、数字器官孪生进入临床试验等当日科技要闻。
Terence Tao blog RSS

SAIR 竞赛——Lean 内核挑战赛

这是一则竞赛公告:SAIR 基金会与 Lean FRO 联合发起多阶段的 Lean 内核挑战赛,第一阶段围绕八个固定问题(斐波那契、整数分拆、Mertens 函数、素数计数、矩阵积和式、Rule 110、SHA-256、多项式判别式)征集算法,并要求参赛者在 Lean 中证明其算法对每个输入都符合给定规范,提交截止日期为 2026 年 11 月 20 日 23:59 AoE。
Biology of reproduction

用免疫荧光染色与人工智能分析流程分割胎盘组织

该研究开发了一个基于HALO AI的胎盘组织分类器,利用PLAP与DAPI染色将切片分割为绒毛核心、绒毛滋养层(VT)和绒毛间隙(IVS),并用SDC-1与vimentin染色验证了分类区域内面积与强度测量的准确性,在整张切片扫描图像上使染色分析面积较单个视野增加245倍。
PLOS digital health

学术儿科医学中心对符合HIPAA要求的大语言模型聊天机器人的使用情况

这项混合方法案例研究分析了某学术儿科医学中心在14个月内对符合HIPAA要求的大语言模型聊天机器人“InternalGPT”的使用情况,发现约15,788名员工中有2,149人(13.6%)申请访问权限,其中52.8%至少使用过一次,前20%的用户消耗了69.4%的token,而在461名持续使用者中,92名自报调查受访者报告平均生产力提升30%,在多种外推假设下对应630万至1,890万美元的探索性感知生产力价值。
Medical teacher

面向观察式临床实习的AI即时反馈系统:设计与可行性研究

本研究采用设计本位研究框架,为89名柔道整复专业本科生在为期四天的观察式临床实习中部署了一套AI驱动的即时反馈系统,学生每日提交反思笔记并在1分钟内获得基于量规的AI评分与反馈;系统356次请求全部成功处理,每日笔记提交率超过98%、自评完成率超过95%,学生问卷反馈积极;作为探索性外部检验,3名盲评临床教育者对30名随机抽取学生的120份笔记独立评分,与AI总分呈中等秩相关(Spearman's ρ = .495)但绝对一致性有限(ICC = .399),AI总分从第1天到第2天上升后趋于平稳,而人类评分未再现这一早期上升,不过人类对观察具体性的评分从第1天到第4天有所提高。
Clinical and molecular hepatology

面向肝病学的AI虚拟细胞:单细胞模型中的表征、生成、动力学与干预

这篇综述将当前通往肝脏AI虚拟细胞(AIVC)的研究组织为三条互补建模路线——生成模型表征细胞状态、动力学与转运模型推断状态转换、预训练或基础模型检验表征能否跨供体、病因、疾病阶段与平台迁移——并以扰动响应预测作为贯穿性评估,指出已发表模型仅展示了图谱整合、轨迹推断、可迁移表征与回顾性响应程序等单个组件,尚不构成经前瞻性验证的肝脏模拟器,近期应优先用于实验选择与假设生成,临床决策支持仍是更长期目标。
Molecular Biomedicine

解码胰腺癌神经-肿瘤互作:机制、免疫抑制网络与治疗机会

这篇综述系统梳理了胰腺导管腺癌中嗜神经侵袭(PNI)的分子机制,提出涵盖肿瘤与神经相互趋化、肿瘤-神经界面黏附与侵袭、细胞外基质重塑及神经可塑性改变的四阶段统一模型,将嗜神经侵袭微环境定义为神经-免疫豁免庇护所,并总结了靶向神经-免疫-肿瘤轴的治疗策略、在研临床试验以及多组学与人工智能在PNI诊断、机制发现和治疗优化中的应用前景。
Studies in health technology and informatics

面向临床统计分析的AI“氛围编程”基准测试:肺动脉高压研究中的结构化评估

该研究让五个当前大语言模型(GPT 5.3、Claude Sonnet 4.6、Gemini 2.5 Flash、Perplexity 和 Grok)在相同数据集与标准化提示下复现一项已发表临床工作流中经专家验证的三类统计分析任务——描述性表格生成、Kaplan–Meier生存分析和Cox比例风险建模,并将输出与两位受过数理统计训练的专家的分析在分组正确性、数值准确性、缺失值处理和生成的R代码质量方面进行比较,结果显示所有模型在变量被明确指定后都能给出正确的描述性统计,两个模型因变量名歧义在初始描述性基准中失败但在提示澄清后恢复,所有模型都复现了正确的Kaplan–Meier p值但图形完整性不同,Cox基准
Philosophical transactions of the Royal Society of London. Series B, Biological sciences

功能性神经障碍在数字医疗中的未满足需求

本文是一篇讨论性文章,系统梳理了数字医疗在功能性神经障碍(FND)中可发挥作用的六个方向——利用大型生物样本库与临床数据集揭示流行病学、共病、机制、经济负担及可能的治疗效果,用人工智能辅助超出临床承载力的复杂耗时评估,用自动化震颤分析、功能性运动体征量化和语音识别等数字工具提升诊断精度,通过在线工具与远程医疗改善自我管理和治疗可及性,借助可穿戴设备与远程医疗改进疗效测量与现有治疗,以及发展人工智能辅助治疗、生物反馈和虚拟或增强现实等新疗法——同时讨论了去人格化、隐私泄露、治疗替代、数字依赖和数字排斥等风险,并指出由临床医生而非干预本身带来的“治疗师效应”难以在数字环境中复制,最终提出应让技术进
IEEE transactions on computational biology and bioinformatics

RaFT-DM:面向多标签蛋白质功能预测的残基感知融合Transformer与领域记忆机制

本次加载的文本仅包含论文标题《RaFT-DM: A Residue-Aware Fusion Transformer With Domain-Wise Memory for Accurate Multi-Label Protein Function Prediction》以及IEEE Xplore页面的导航、账户、版权与前端脚本等模板内容,未包含摘要、方法、实验或结果等正文信息,因此只能确认该工作提出了一种名为RaFT-DM、结合残基感知融合Transformer与领域记忆机制、用于多标签蛋白质功能预测的方法,无法概述其具体做法与发现。
World journal of urology

多模态大语言模型用于膀胱镜膀胱肿瘤检测:一项回顾性基准评测

该研究回顾性分析了1,754张带标签的公开膀胱镜图像,测试Direct、Book-based与Optimized三种提示词在GPT-5.2、GPT-5、GPT-5-Mini与GPT-5-Nano上的良恶性分类表现,发现GPT-5与GPT-5-Mini在优化提示词下准确率分别达86.7%与89.2%,GPT-5在优化提示词下高置信度分诊在62.0%图像覆盖率下达到98.1%准确率、94.6%特异度与99.1%敏感度,提示工程虽未带来统计显著的性能提升,但改善了置信度校准与分诊表现。
Nanoscale

用于癌症分子成像的可编程纳米探针:迈向自适应与情境响应式诊断

这篇综述系统梳理了刺激响应型纳米探针的设计原理与功能架构,指出其可针对肿瘤内源性线索(如pH约6.5-6.8、谷胱甘肽2-10 mM、酶过表达、缺氧低于2% O2及氧化还原梯度)和外源性触发(近红外光700-1000 nm、磁场、超声)实现情境响应式激活与信号调控,带来5-20倍信号放大,并整合多模态成像与人工智能以实现实时数据解读和自适应诊断。
PLoS computational biology

机器学习解码复发性妊娠丢失中的母体免疫特征

该研究对正常妊娠与染色体核型正常的复发性妊娠丢失(RPL)蜕膜组织进行单细胞RNA测序,结合基因型来源判定、分层机器学习(devCellPy)与Transformer基础模型(scGPT)交叉验证,发现RPL蜕膜免疫激活信号升高、母体T细胞携带最稳定可泛化的RPL相关特征,并通过网络中心性分析与来源控制的表达过滤收敛提名CXCR4与JUN为候选可成药靶点。
PLOS digital health

用定制提示策略与混合方法评估大语言模型生成放射报告通俗摘要的能力

该研究以BioNLP 2023报告摘要数据集中的100份放射报告为输入,让五个大语言模型在各自经预试验选定的提示风格下(GPT-4用少样本、GPT-4o mini与Gemini 1.5 Pro/Flash用生成知识、Llama 3.1用零样本)生成面向患者的通俗摘要,再由两名放射科专科培训医师、两个大型推理模型(Gemini 2.5 Pro与GPT-oss-120b)以及可读性指标进行混合评估,结果显示Gemini 1.5 Flash与Pro配合生成知识提示在可操作性、最少监督可用性和可读性上排名最高,GPT-4少样本在人类评分者眼中准确率最高(98%),且人类专家与大型推理模型的评分高度一致。
Faraday Discussions

以可解释AI与“材料基因”描述真实工况下的催化:SISSO符号回归结合偏效应敏感性分析

该工作将SISSO符号回归与基于偏导数的偏效应(PE)敏感性分析结合,用于分析9种负载型钯基双金属合金纳米颗粒在浓缩乙炔流选择性加氢中的539个乙烯选择性测量值,从20个候选初级特征中选出8个“材料基因”,并通过全局与逐材料的敏感性评分指出平均d带中心、氢的表面与次表面结合能以及实验测得的平均颗粒直径为最具影响力的基因,从而在不需要显式原子尺度模拟全部物理过程的前提下给出对乙烯选择性的统计描述。
Science (New York, N.Y.)

关于AI与生物武器的警示性报告在科学家中引发分歧

据这篇报道,Anthropic 表示研究人员可能曾利用其模型 Claude 从事与病毒和毒素相关的恶意工作,而这份警示性报告在科学界内部引发了分歧。
PloS one

确定性到随机性干预减少不适当处方中的药物相互作用:一项系统综述

该综述按PRISMA 2020与SPIDER框架检索PubMed、Scopus、ScienceDirect和IEEE Xplore,纳入10项评估减少药物相互作用或不适当处方的计算与临床决策支持干预的原始研究,按确定性、本体论和随机/生成式三类进行叙述性综合,并用PROBAST+AI评估偏倚风险,发现早期确定性系统在处方流程指标上有适度改善但与患者层面结局关联不一致,近期随机与生成式模型报告了较强的内部性能指标,而AI驱动研究在分析域普遍存在高偏倚风险,主要源于外部验证有限、校准报告不足以及过拟合与数据泄漏处理不清,因此现有证据尚不能证明方法学复杂度的提升带来了成比例的可临床可靠决策支持改善。
PLOS digital health

以医学知识为根基的LLM智能体工具:从病历中识别患者安全事件

该研究提出SAFE-AI框架,将大语言模型的角色限制为从急诊病历中零样本抽取实体,再由基于临床指南本体构建的确定性规则计算图完成判断,在300份儿科院外心脏骤停病历(18,402行临床信息)上检测肾上腺素过量与给药延迟,报告过量检测准确率97.9%、延迟检测准确率91.6%,优于所比较的基线模型。
Archives of toxicology

人工智能在毒理学中的应用:当前进展、挑战与未来方向

这篇综述通过检索PubMed/MEDLINE、Web of Science和Scopus(2000-2026年)并补充OECD、FDA、EMA、EFSA和EPA的指导文件,梳理了毒理学中AI从基于规则的专家系统到深度学习、大语言模型和多模态架构的发展,指出图神经网络、多任务深度学习等在药物性肝损伤、hERG心脏毒性和Ames致突变性等基准研究中表现出有竞争力的性能,同时外部验证报告不一致、端点特异性模型泛化困难以及大语言模型幻觉带来监管风险,结论是AI模型可增强但尚不能替代实验毒理学。
Nanoscale

金属有机框架限域调控钙钛矿性能提升综述

该综述系统梳理了以金属有机框架(MOF)为主体、金属卤化物钙钛矿为客体的主客体复合体系,归纳了ship-in-a-bottle、bottle-around-ship与一锅法三类合成策略,指出MOF的纳米限域、界面钝化与电子耦合可抑制离子迁移、缺陷与降解,从而提升光致发光量子产率与稳定性,并可通过孔径、配体功能化与成核动力学调控发射波长与激子动力学,展望了光伏、传感、信息加密、防伪与发光器件等应用及人工智能结合理论模拟的设计优化路径。
Studies in health technology and informatics

用本地大语言模型从临床试验记录中自动抽取基因资格标准:一项技术案例报告

该技术案例报告开发并评估了一套结合本地大语言模型与HUGO基因命名规则校验的系统,用于从临床试验记录中抽取并结构化突变资格标准(识别突变基因、区分纳入与排除标准、归属到各研究组),在4,918项试验上运行并为1,010项研究生成结构化表示,42项试验的专家复核显示88.1%的研究被正确标注、单项资格标准精确率为80%,失败主要来自幻觉基因与缩写误判。
Neurointervention

超级老龄化社会中的慢性硬膜下血肿:从外伤性偶然事件到自我延续的血管炎症性疾病

这篇综述重新梳理了慢性硬膜下血肿(cSDH)的疾病概念,将其从单纯头部外伤后的机械性积血,重新定位为由外膜炎症、病理性血管生成与纤溶亢进驱动的慢性自我延续性疾病,并在此基础上综述了患者与血肿相关危险因素、传统保守与手术治疗,重点评估了脑膜中动脉栓塞(MMAE)作为机制靶向的辅助或替代治疗的最新证据,同时讨论了复发负担、成本效益、韩国等国的报销实践,以及基于生物标志物和人工智能的患者分层与经血管早期进入硬膜下腔等新兴方向。
Journal of the American Medical Informatics Association : JAMIA

DiagnosticXchange:面向临床AI系统的安全性、效率与诊断推理开源评估框架

该研究开发并验证了开源临床模拟评估框架DiagnosticXchange,让AI系统在模拟医院中通过开具检查、申请影像和操作来诊断病例,并将每个动作映射到CPT编码以量化成本、时间、工作相对价值单位和侵入性;用8个大语言模型在19个专科的216个同行评审病例上完成1728次会话,结果显示三个系统准确率几乎相同(93.5%–94.0%)却在成本上差异显著(P<.001,最高与最低相差1.75倍)、医生监督需求相差2.1倍,最高效系统在5000美元内解决86%病例而最耗资源系统需10000美元才能达到同等准确率,无监督聚类识别出3种推理策略且行为特征比系统身份更能预测资源消耗(AIC 4683对50
Stroke

急性卒中管理中的负责任人工智能:可解释性与公平性的综述

这篇综述综合了急性卒中管理中可解释人工智能与公平性人工智能的现有文献,指出人工智能已在大血管闭塞检测、Alberta卒中项目早期CT评分和功能预后预测等任务上表现良好,但可解释性方法多为事后近似且很少被正式检验,公平性评估因人口统计学元数据有限、监管限制和缺乏卒中专用公平标准而少见,可解释性与公平性彼此脱节,泛化性也受数据集划分策略与报告实践影响,因此呼吁建立同时评估可解释性、公平性与泛化性的统一评价框架。
Ocular immunology and inflammation

宏基因组深度测序在玻璃体视网膜淋巴瘤中识别与化疗耐药相关的基因突变

该研究对49例经细胞病理学、免疫组化、流式细胞术和/或MYD88 PCR确诊的玻璃体视网膜淋巴瘤(VRL)患者的眼内标本进行宿主基因组宏基因组深度测序(MDS),并将检出的基因突变与癌症体细胞突变目录(COSMIC)数据库交叉比对,结果在4例患者的6份标本中发现8个与化疗耐药相关的基因突变,其中3例患者的4份标本携带与甲氨蝶呤(VRL主要治疗药物)耐药相关的突变,且1例患者在初次玻璃体切除及随后两次复发时的连续采样中每个时间点均检出不同的耐药相关突变,该患者虽接受包括利妥昔单抗、巩固方案和来那度胺在内的多药治疗仍最终死亡,而其余3例患者保持长期缓解。
Medicinal chemistry research : an international journal for rapid communications on design and mechanisms of action of biologically active agents

人工智能辅助药物发现中的先导化合物优化:连接计算进展与转化挑战

这篇综述系统梳理了人工智能与机器学习在先导化合物优化中的应用现状,涵盖图神经网络、Transformer架构、扩散模型与化学基础模型在分子设计与性质预测方面的进展,并讨论了以数据为中心的人工智能、不确定性量化、可信人工智能、人工智能优化悖论以及从分子预测转向科学决策等新兴概念,指出尽管工业界采用日益增加,人工智能仍依赖高质量实验数据、模型泛化能力与严格实验验证,未来进展更多取决于能在迭代式先导优化工作流中改善科学决策的可信人工智能系统,而非日益复杂的算法。
bioRxiv

SPHERE:让敏感人类数据在AI时代可被直接使用与共享

作者提出SPHERE这一无需建模(model-free)的方法,将敏感数据集转化为可共享的“合成孪生”(synthetic twin),使AI系统与协作者可直接使用而原始记录不离开本地环境;在覆盖五个科学领域的33个数据集上,该方法在抵御对抗性重识别攻击的同时保留了数据的统计结构(均值、方差与相关性被精确复现,线性分析中的效应量与P值数值一致,非线性机器学习效用得以保留,每个孪生可在笔记本电脑上数秒生成),前沿AI智能体在孪生上的科学结论与在原始记录上一致,并可在UK Biobank规模上复现基因组与蛋白质组范围的结果、在三个独立队列与联盟中重现里程碑研究的发现,还首次以涵盖九种模态的SPHERE
Journal of Chemical Information and Modeling

大语言模型在上下文中的分子性质预测:一项关于记忆与知识冲突的盲化研究

该研究在三个 MoleculeNet 数据集(Delaney 溶解度、亲脂性、QM7 原子化能)上,用逐步减少可用信息的盲化流程,配合 0、60、1000 样本的上下文示例数量,评估 GPT-4.1、GPT-5、Gemini 2.5 三个家族共九个 LLM 变体,以判断其分子性质预测是真正的上下文回归还是对记忆目标值的逐字检索,并加入记忆实验的正负对照、多示例实验的结构参照基线以及自助法置信区间;结果显示在这些既有基准上没有逐字检索的证据,而盲化会暴露出预训练知识与上下文信息之间的冲突。
PLOS digital health

M3:对话式大语言模型简化临床数据的安全访问、理解与分析

该研究提出并评估了 M3——一个基于模型上下文协议(MCP)的 Python 服务器系统,使研究者能用自然语言查询 MIMIC-IV 重症监护数据库;在 EHRSQL 2024 基准各 100 道可回答与不可回答问题上,Claude Sonnet 4 在可回答问题上达到 94% 准确率、可在消费级硬件本地部署的开源权重模型 gpt-oss-20B 达到 93%(McNemar 检验 p=1.00,未发现可检测差异),而 gpt-oss-20B 在不可回答问题上正确弃答率为 69%,错误主要源于问题歧义与模式映射不匹配。
Studies in health technology and informatics

大语言模型用于临床笔记简化:医学文本可读性的系统综述与实验评估

该研究结合系统文献综述与实验评估,用五个合成德语临床笔记和标准化提示测试十款免费可用的大语言模型,发现所有模型都显著增加文本长度并持续降低专业术语与缩写密度,但没有任何模型在所有可读性指标上取得一致改善,Mistral、ChatGPT 和 Copilot 在语言简化与文本长度之间平衡效率最高,提示传统可读性指标在医学领域存在局限,应补充领域特定度量。
Therapeutic delivery

纳米结构脂质载体经鼻递送大麻二酚治疗Dravet与Lennox-Gastaut综合征:从临床前前景到临床转化

这篇综述检索了PubMed、Scopus、Web of Science与Google Scholar截至2026年3月的文献,梳理了纳米结构脂质载体(NLC)经鼻递送大麻二酚(CBD)用于Dravet综合征(DS)与Lennox-Gastaut综合征(LGS)的临床前证据、安全性与监管考量及临床开发路径,指出经鼻NLC-CBD在动物模型中可提高脑内CBD水平、增强脑靶向并延长中枢暴露,但尚需设计良好的临床试验来验证其在DS与LGS患儿中的安全性、药代动力学与疗效。
bioRxiv

3D空间相互作用组学在单细胞中绘制NF-κB多蛋白信号体动态

该工作提出以智能顺序邻近连接测定(iseqPLA)结合转盘共聚焦显微与三维重建,对单细胞内源性NF-κB蛋白相互作用进行空间剖析,将共定位信号点簇视为超级复合物空间组织的度量,并在NIH-3T3小鼠成纤维细胞、囊性纤维化(CF)患者来源巨噬细胞与IMR-90人成纤维细胞共培养体系以及一组独立的健康与CF供体单核细胞-成纤维细胞共培养中追踪超级复合物解离、p65核转位与负反馈启动,报告三项发现:三维体积定量较二维投影降低核质比测量方差、细胞外基质包被选择影响NF-κB响应细胞比例、CF气道条件化巨噬细胞在CF模型中放大邻近成纤维细胞的旁分泌NF-κB信号,并以在精选转录组数据上微调的单细胞生成式
Cancer biotherapy & radiopharmaceuticals

双参数MRI影像组学联合血清骨转换标志物预测前列腺癌术后骨转移:面向靶向放射性核素治疗的精准筛选

该研究在一项前瞻性单中心队列中纳入143例临床局限性前列腺癌(cT1-2N0M0)并接受腹腔镜根治性前列腺切除术的患者,术前检测血清骨代谢指标(如骨钙素N端中段片段和碱性磷酸酶)并提取双参数MRI影像组学变量(表观扩散系数均值与Ktrans均值),用多变量逻辑回归整合血清与影像标志物构建预测模型,结果显示整合模型ROC曲线下面积为0.984,显著优于单一生物标志物与影像特征(均p<0.001),决策曲线分析显示临床净获益且校准良好(Hosmer-Lemeshow检验p=0.830),按模型风险分层分为高风险组53例与低风险组90例,两组无骨转移生存差异显著(log-rank p<0.001)。
Journal of Agricultural and Food Chemistry

食源性降压肽:制备策略、多靶点机制与机器学习进展综述

这篇综述系统梳理了食源性降压肽的来源与新型制备策略、其多靶点作用机制与构效关系,并总结了机器学习在降压肽精准识别与活性预测中的应用,指出未来需整合先进生物技术与智能平台以加速其从实验室走向临床应用。
Journal of medical Internet research

大语言模型在肝胆胰肿瘤多学科决策中的稳定性与一致性:回顾性比较可行性研究

这项回顾性研究将107例单中心肝胆胰肿瘤多学科团队(MDT)会议病例的标准化摘要重复4次提交给GPT-4o、GPT-5.2、Gemini 3 Pro和Claude Sonnet 4.5四个大语言模型,发现模型间回答稳定性差异显著(Gemini 3 Pro不一致率最低,均值12.8%,Fleiss κ=0.737;GPT-4o最高,均值30.2%,Fleiss κ=0.430),与MDT决策的一致率在初始回答下为48.6%–72.9%、在众数回答下为66.3%–74.5%,且手术类F1分数(0.400–0.520)持续低于化疗类(0.621–0.836),提示仅用一致性不足以评估大语言模型作为临床决策支持工具。
Science (New York, N.Y.)

虚拟生物科技公司:面向治疗发现与开发的多智能体AI框架

该工作提出“Virtual Biotech”——一个仿照药物开发公司组织架构、由AI智能体组成并覆盖靶点发现、安全性评估、模态选择与临床开发等部门的多智能体系统,并在三个药物开发决策点上展示其用途:由超过37,000个智能体对55,984项试验的结果进行标注,发现靶向细胞类型特异性基因的药物上市可能性高48%、不良事件少32%;整合多模态证据提出一项肺癌治疗策略;以及分析一项已终止的溃疡性结肠炎试验并推断其潜在失败机制。
发表出处待核验

EQUAINE:让机器理解马匹数据并持续从中学习

这篇论文探讨如何用传感器信号结合人工智能模型来量化马匹的运动与呼吸状态,发现单一肢体传感器即可在低采样率下准确分类地面类型,头部、肩隆与骨盆传感器组合可区分正常与跛行步态且性能随前肢或后肢跛行而异,上身传感器比肢体传感器更能估计垂直地面力,降采样音频信号可计算动态呼吸频率,并通过可解释人工智能确认模型依赖与兽医相似的 kinematics 标志,同时提出面向轻驾车赛马的数据采集平台并公开音频数据集。
bioRxiv

时间序列基础模型实现湖泊生态系统精准预测

该研究以日本两座生态条件迥异的湖泊(深水分层的琵琶湖与浅水富营养化的霞浦湖)长达30年的月度水质监测记录为数据基础,将Transformer架构的Chronos-T5与概率模型Lag-Llama两个时间序列基础模型,同15个统计(AR、ARIMA、SARIMA、Prophet)、机器学习(随机森林、XGBoost、KNN、SVR)与深度学习(LSTM、CNN、TCN及SSA混合)模型进行基准比较,发现微调后的Chronos-T5在全部六个监测站点均排名第一,对溶解氧、水温、pH及氮磷营养盐等参数取得R²>0.80–1.00的高精度,而叶绿素a在所有模型中R²均低于0.30,并识别出约14年的最
发表出处待核验

循环中的人:生成式AI漩涡中UX实践的伦理能动性与思辨路径

这项研究以作者本人在微软担任UX从业者与AI伦理团队成员的经历为出发点,结合对九位在生成式AI工作中经历过价值错位的从业者的半结构化访谈,采用自反性主题分析与175字思辨微小说作为分析工具,提出三个主题——从业者对生成式AI更多是矛盾而非反对、因结构性障碍与职场伦理讨论缺失而感到伦理上被去权、并以“靠进去”和“退出来”的策略行使能动性——进而以“循环”为隐喻论证:要求从业者对其无法真正影响的结果承担伦理责任日益难以成立,而“另类思考”与自我书写仍可实践,并最终落为一个分支叙事设计原型《HUMAN IN A LOOP:一本UX伦理选择你自己的冒险书》。
Journal of medical systems

CLASS:面向临床笔记非结构化数据抽取的大语言模型流水线探索性实施与可行性报告

该报告开发了CLASS——一个在机构安全环境内运行、由专家概念表、任务专用提示集与模式约束输出组成的Python模块化大语言模型流水线,用于从临床笔记中抽取结构化数据,并在单中心儿科食管气道治疗手术(EATS)回顾性手术记录上做探索性评估:与外科医生裁定相比,20份最长笔记(3,960个笔记-操作对)的观察一致度较高(F1 0.9967),同时CLASS提出28个候选操作变体或新增项,其中18个(64.3%)被判定具有临床价值,而外科医生另指出12项CLASS未发现的操作用于说明该流水线在特定单中心、单服务场景下抽取复杂非编码操作信息是可行的。
Journal of medical Internet research

面向临床决策的语言模型微调、检索增强生成与混合适配:系统综述

该研究遵循PRISMA 2020指南检索PubMed/MEDLINE、Scopus与Web of Science(2018年1月至2026年5月),从1890条记录中纳入35项2024至2026年发表的研究,按微调或参数高效微调(7/35,20%)、检索增强生成(17/35,48.6%)与混合方法(11/35,31.4%)分组进行描述性综合,发现微调在窄任务分类中表现突出(如癌症检测AUC最高0.912、重性抑郁障碍预测AUC 0.892),检索增强生成提升指南依从性与诊断准确性(分别由71.1%升至92.1%、由78.9%升至94.7%)但在更大推理型模型上收益不一致,混合系统在复杂临床流程中表现最
Biomedical physics & engineering express

HARU-Net:用于锥形束CT边缘保留去噪的混合注意力残差U-Net

该研究提出HARU-Net,一种混合注意力残差U-Net,在人类下颌骨尸体标本的高分辨率锥形束CT(CBCT)数据上训练,用于低剂量CBCT去噪;其架构在每条跳跃连接中嵌入混合注意力Transformer模块、在瓶颈处设置残差混合注意力Transformer组、并使用残差学习卷积块,报告达到最高峰值信噪比37.52 dB、次高SSIM 0.9557和最低GMSD 0.1084,同时相比基于Transformer的方法计算复杂度显著更低。
Studies in health technology and informatics

德语临床表达到 SNOMED CT 的医学概念归一化:领域嵌入检索加 LLM 重排优于纯 LLM 方案

该研究针对德语临床短表达到 SNOMED CT 的医学概念归一化任务,比较了直接使用 GPT-5.4 的纯大语言模型方案与结合 medBERT.de 双编码器嵌入检索和 RAG 式 LLM 重排的混合方案,结果显示纯 LLM 基线 Recall@1 为 0.235、Recall@3 为 0.297、Recall@5 为 0.303,而嵌入检索方案达到 Recall@1 0.681、Recall@3 0.783、Recall@5 0.812,加入 RAG 重排后 Recall@1 进一步提升至 0.771,Recall@3 和 Recall@5 分别为 0.809 和 0.812。
IEEE transactions on medical imaging

SurgDepth:面向手术场景理解的深度基础模型测试时自适应

该工作提出 SurgDepth,一种无需任何标注手术数据的测试时自适应框架,通过立体光度一致性与翻转等变性两种自监督信号、选择性解码器自适应以及进度感知锚点正则化和低照度序列结构信任保护两项免调参可靠性机制,将自然图像预训练的深度基础模型适配到内窥镜手术场景;作者报告在立体图像对上 AbsRel 最多降低 63%、无立体时降低 42%,在五个跨域评测设置中改善四个,跨七种基础模型泛化,并在完整标准 Hamlyn 基准上取得所报告方法中最低的 AbsRel(0.128),所有结果均为中值缩放后的相对深度,20 步收敛(0.4 秒)。
Educational Technology Research and Development

教育领域系统综述中的AI辅助数据提取:LLM准确性实证与人在回路工具AIDE

该研究通过一项先导研究和一项主研究,用Claude 2.1、ChatPDF、GPT-4以及Gemini 1.5 Flash、Gemini 1.5 Pro、Mistral Large 2等LLM,从教育领域已发表综述的112项研究中提取显性变量与派生变量并与人工编码对比,发现LLM在提取显性数据时一致性较高但在按预设类别归类时明显下降、Cohen's Kappa普遍偏低,据此提出并开发了强制逐条人工验证的开源人在回路(HIL)数据提取工具AIDE。
Die Ophthalmologie

德国眼科医生对AI环境记录系统的接受度与需求调查

该研究通过对德国某区域医师网络中34名眼科医生(中位年龄49岁,47%为女性)进行匿名在线问卷调查,发现多数受访者将20–39%的工作时间用于临床文档记录,约四分之三对可靠且安全的环境记录系统表示出使用兴趣,主要感知益处是减少文档时间和增加患者诊疗时间,主要障碍是AI可靠性、与现有IT系统的整合及数据保护方面的顾虑,且受访者更偏好本地部署方案而非云端方案。
BIROn (Birkbeck, University of London)

信息高速公路通向虚无:“持久”超链接标识符与幽灵学术对象

这篇主题演讲探讨了超链接可以指向任何地方、也可以指向虚无这一特性,指出被赋予 DOI 的学术内容虽以超链接形式呈现并带有独立元数据所赋予的权威性,却可能实例化出描述从未存在、也永远不会存在之目标的“幽灵引用对象”,并与大语言模型生成论文及其“腐坏的幻觉式引用”叠加,使这类幽灵研究对象在学术记录中扩散,进而牵动 DOI 超链接的权威主张与数字保存的实践意涵。
bioRxiv

用自然语言智能体控制显微镜:MicroClaw 概览

作者提出 MicroClaw,一个 AI 智能体,可就实验与系统相关参数和方法提供建议,并协作规划与执行跨显微镜平台的多样、复杂且可复用的成像工作流,从而无需专家知识。
bioRxiv

ModelSEED 生物化学数据库 2026 更新:多源热力学数据的证据分级

该更新将 ModelSEED 生物化学数据库扩展至约 46,000 个化合物、约 56,000 个反应和约 37,000 个代谢结构,把热力学数据从两个来源扩展到四个来源(基团贡献法、eQuilibrator 3.0、dGPredictor 与实验值)并各自保留其不确定度,对约 33,000 个反应按证据强度给出金、银、铜三级评分,同时发布由大语言模型集成给出的反应方向预测,并用新的冲突消解流程记录结构来源间的取舍。
Faraday Discussions

单原子催化剂理论建模的批判性评估

该研究以析氢反应(HER)为典型案例,系统分析了当前基于计算氢电极(CHE)等第一性原理方法在预测单原子催化剂(SACs)活性时的局限,指出反应热力学对局部原子环境的敏感性、实验结构未知、SACs特有中间体被忽略、溶剂效应、工况下催化剂演化与稳定性以及密度泛函理论固有近似等因素共同导致理论预测与实验结果的偏差,并提出需整合这些化学复杂性与不确定性、借助人工智能与数据驱动方法发展更稳健的描述符与预测框架。
Chemical & Biomedical Imaging

光学衍射层析与可解释机器学习揭示红细胞内配子体期疟疾的生物物理特征

该研究将无标记光学衍射层析(ODT)与可解释机器学习结合,从同步培养的恶性疟原虫感染红细胞的三维折射率层析图中提取形态与生物物理描述符(球形度、实心度、离心率、干质量、最大折射率)以及自监督视觉Transformer(ViT)的图像表征,发现配子体期感染红细胞球形度显著降低、离心率升高,联合特征空间在多分类(正常、环状体、配子体)中达到88.3%准确率、在二分类(正常与感染)中达到98.1%准确率,SHAP分析显示深度学习特征对正常与环状体期最强、手工特征对配子体期分类关键。
Studies in health technology and informatics

面向本地 Whisper 医疗转写后处理的嵌入评估与基准测试框架

该研究提出一个无需参考摘要的评估框架,将嵌入层面的转写-摘要语义相似度、重复生成稳定性分析与结构化人工评估相结合,用于对本地 Whisper 系统产出的临床转写进行 LLM 后处理模型的基准测试,并在 26 段德语医患对话上由四个 LLM 生成 416 份摘要进行验证,发现 GPT-OSS-120B 与 MedGemma-27B 在多数嵌入模型下取得最高相似度、重复运行余弦相似度通常超过 0.90,且嵌入相似度信号与人工质量判断仅部分一致。
bioRxiv

PlantRegMoD:面向植物再生研究的整合型AI驱动多组学数据库

该工作构建了PlantRegMoD,一个面向植物再生的AI驱动整合型多组学数据库,整合了来自147个项目、32个物种、2,593个样本的20.54 TB标准化多组学数据,建立了涵盖五大类、九种再生模型的统一层级分类体系,整理了236个再生基因及其在58个代表性植物物种中的28,190个同源基因,并包含196,423个单细胞和超过881万个表观遗传峰,配备九个在线组学工具和基于RAG的智能问答系统。
Studies in health technology and informatics

临床编码映射中的LLM工具使用:从非结构化德语临床笔记中自动提取药物与诊断信息的试点研究

该试点研究将35份来自5名患者的德语医生笔记匿名化,构建了一条药物提取与映射流程和两条诊断流程(其中一条基于RAG、一条基于智能体AI),在本地GPU-PC上运行三种开放权重LLM,结果显示药物名称提取F1可达0.95、药物映射F1可达0.78,而诊断编码F1不超过0.12、宽泛类别映射F1为0.18,作者据此认为LLM适合用于研究数据库的药物信息提取,但当前开放权重模型尚不足以支撑直接依赖其表现的临床诊疗场景。
Science (New York, N.Y.)

面向腹部CT诊断的专家级通才AI:RADAR

该工作开发了RADAR——一个在超过40万例增强腹部CT检查和1500万解剖结构对应的图文对上训练的通用视觉-语言模型,直接利用临床报告学习而无需人工标注,在18个解剖结构和146种影像表现的内部与外部多中心评估中取得高诊断性能与稳健泛化,并在读者研究中使26名放射科医师的诊断敏感度提升约10%。
Rehabilitation psychology

人工智能在残疾人社会支持中的应用图谱:一项系统性范围综述

该研究遵循PRISMA-ScR指南,在PubMed与Web of Science中开展系统性范围综述,共纳入72项研究,从参与、自主与环境适配的视角梳理了人工智能在残疾人社会支持中的应用,发现应用集中于“移动与导航辅助”(n=20,41.7%)、“沟通与信息无障碍”(n=14,29.2%)、“日常生活智能辅助”(n=7,14.6%)、“教育与职业赋能”(n=5,8.3%)和“心理健康支持与社会融入”(n=3,6.3%)五大领域,并识别出数据隐私(58.3%)、训练数据不足(25.0%)、实施成本高(25.0%)、算法偏见(20.8%)和真实世界获益证据有限(20.8%)等挑战,指出该领域存在重功能
Journal of pediatric hematology/oncology

AI辅助生成儿童癌症与造血干细胞移植幸存者的长期随访建议

该可行性研究将去标识化治疗摘要输入OpenAI GPT-4o,用结构化提示生成儿童癌症与造血干细胞移植幸存者的长期随访建议草稿,并在40名幸存者的独立验证队列中与临床医生依据机构规范和儿童肿瘤协作组长期随访指南(第5版)制定的建议比较,发现AI生成467条、医生生成446条,446条医生建议中385条(86.3%)被AI识别,467条AI建议中385条(82.4%)也见于医生计划,多数不一致集中在放疗相关暴露和需要细致临床解读的幸存者情境。
Anthropic

生命科学验证计划(LSVP):面向生命科学专业人员的分级访问与离线监控机制

Anthropic 于 2026 年 9 月 17 日发布生命科学验证计划(LSVP),通过验证研究资质、安全标准与伦理监督,向生命科学团队授予“标准使用”与“高风险使用”两类授权,使其可在 Mythos、Opus、Sonnet 模型上开展此前被通用模型拦截的药物发现、研究生物学、临床开发与制造等工作,并将防护机制从实时拦截转为离线监控,要求对 LSVP 流量保留 30 天数据。
Studies in health technology and informatics

本地大语言模型在德国医生信件中检测口服抗凝治疗的指南驱动转变

该研究使用院内本地部署的微调 Llama-3.1-70b 药物信息抽取流程,对 2012 年 538 封无金标准标注的常规医生信件进行自动抽取,并与 2020/21 年 500 封 CARDIO:DE 信件(使用金标准标注)对比,发现直接口服抗凝药(DOAC)占比从 16.9% 升至 59.9%,维生素 K 拮抗剂(VKA)占比从 37.7% 降至 9.9%,DOAC 内主导活性成分由利伐沙班转为阿哌沙班,且人工复核显示残余错误主要与通用药物提及和缺失的药物-原因关系有关,而非抽取本身错误。
The International journal of prosthodontics

人工智能在评估口腔医学本科生中的表现:以学生成绩为基准的AI平台对比

这项横断面比较研究让49名口腔医学二年级学生在标准化条件下完成45道修复工艺学多选题期末考试,并将同一套题目提交给ChatGPT、Gemini和DeepSeek三个AI系统,用ANOVA、Cronbach Alpha和Tukey HSD分析组间差异,结果显示DeepSeek在高难度题上取得满分、ChatGPT在多次尝试中表现出适应性提升,两者均显著优于学生群体,而Gemini准确率较低且稳定,模型间差异具有统计学意义(P=0.036,η²=0.891),据此提出无监督在线总结性考试在学术诚信方面需要重新审视。
European heart journal. Cardiovascular Imaging

超声心动图在肺动脉高压风险评估中的增量价值:ULTRA RIGHT VALUE 注册研究的人工智能机器学习分析

在 401 例欧洲多中心前瞻性肺动脉高压(PAH)队列中,将右心室超声心动图参数(尤其是右心室-肺动脉耦联指标)纳入 ESC/ERS 与 REVEAL 2.0 风险评分后,机器学习分析显示死亡与发病预测的 c-index 分别从 0.73 提升至 0.78、从 0.74 提升至 0.79(P<0.01),提示超声心动图可提升现有 PAH 风险评分的预测能力。
GeroScience

深度学习视网膜年龄差与生活方式、全身及眼部健康的关联:一项健康筛查队列研究

该研究基于健康筛查队列的29,530张眼底图像训练多任务模型预测视网膜年龄,并在两个子队列中评估视网膜年龄差(RAG),发现较高的RAG与吸烟(既往吸烟者β=+0.46年、当前吸烟者β=+0.50年)和临床糖尿病(+2.52年)显著相关,且在年龄相关性黄斑变性(+0.60年)和白内障(+1.86年)眼中RAG显著高于正常对照。
PLOS digital health

面向精神分裂症患者信息获取的医疗问答系统构建指南

该研究提出一套以公开在线健康论坛为数据来源、结合主题引导语义建模(TGSM)与检索器-阅读器两阶段流水线的方法,构建了包含415,602条帖子、35个主题、1,050个问答对的精神分裂症问答数据集,并显示在该数据集上微调后的BioBERT在精确率与精确匹配等指标上优于未微调版本及DistilBERT等基线。
arXiv

基于比较预言机的零阶偏好对齐:ComPO 方法

本文提出并分析了一种基于比较预言机的零阶偏好对齐方法 ComPO,它不直接优化可微偏好损失,而是通过扰动当前策略并判断扰动是否提高偏好回答似然、降低非偏好回答似然来提取更新方向,从而利用低似然间隔的“噪声”偏好对;作者在平滑性、梯度稀疏性与预言机兼容性假设下给出了离线基本方案的收敛保证,并引入使用无标注策略生成进行反向 KL 控制的在线版本,在局部覆盖与分布内成对奖励精度下给出性能保证;在 Mistral、Llama、Gemma-2、Qwen3 与 Gemma-3 系列模型上的实验显示其相对现有直接对齐方法有所提升,包括长度控制胜率,成对似然诊断提供了与缓解似然位移一致的证据。
arXiv

PointZero:以3D点轨迹补全作为可迁移3D动力学预训练目标

该工作提出以“3D点轨迹补全”作为预训练目标:给定单次RGB-D观测与稀疏部分3D轨迹,预测所有被观测点的未来3D轨迹,从而在不需要机器人动作标签的情况下学习可迁移的3D动力学先验;作者贡献了覆盖可变形、铰接与刚性物体的290万帧合成数据集并训练出Transformer模型PointZero,在相同数据上优于先前方法,微调后在PGND 3D动力学基准上优于基线,并在7项仿真与真实机器人操作任务中的6项上优于或持平基线,同时通过从零训练分离架构与预训练目标/数据集的贡献,并公开数据集、检查点与完整训练配方。
arXiv

用通用VLM智能体实现上下文内机器人学习:GPT-Policy框架

该工作提出GPT-Policy——一个把现成通用视觉语言模型(VLM)通过共享的“上下文到动作”闭环接口连接到机器人工具的框架,在真实机器人上跨五类上下文(人类视频、机器人视频与动作、目标图像、自交互历史、在线人机交互)评估其上下文内学习能力,发现任务相关上下文可提升成功率并减少决策数与执行时间,但更好的任务理解并不能保证精确接触、可靠的结果验证或物理安全。
arXiv

EarStreAM:面向个性化压力自适应冥想的闭环耳戴系统

本文提出 EarStreAM,一个基于 OpenEarable 2.0 与配套智能手机应用的闭环耳戴系统,通过耳内 PPG 持续监测心率与心率变异性来推断压力升高,触发由大语言模型生成、随用户生理状态实时调整的个性化引导冥想,并在压力回落至基线后自动结束,同时以两种演示模式(含可选压力诱导的生物信号自适应模式与仅冥想模式)展示该闭环流程。
arXiv

在维基百科导语上玩 log(N)-Questions:成对前沿模型之间的通信效率

该技术报告将 Potash 与 Suleman(2019)提出的双智能体 log(N)-Questions 游戏移植到六个前沿语言模型上,让提问者面对 N 篇维基百科导语段落、用恰好 log2(N) 个是非问题找出隐藏目标,而回答者只能看到目标与问题并回复一个词,共运行 408 局、文档集规模从 4 到 1024、总 API 成本 363 美元,发现领先的五个模型之间仅能勉强区分,其胜率随集合规模下降可由单一每轮可靠性参数 p=0.928 的 win=p^{log2 N} 拟合,损失大致均分为回答错误与区分失败,且失败主要源于通信而非推理。
arXiv

模型生长、递归与边界算子如何影响缩放指数

该工作以 prelude–core–coda 循环 Transformer 为统一框架,在 FineWeb 上为每种架构单独拟合计算最优配方并训练到约 10^20 FLOPs 的缩放阶梯,发现模型生长(训练中途增加核心遍数)与边界算子(归一化残差流并重新注入 prelude 输出)能改变预训练的缩放指数,使计算效率优势随规模扩大,而权重解绑只改变常数;在数据受限的多轮训练中,最优循环次数随计算量增长,扩大循环次数比扩大模型规模更省算力。
arXiv

用内部表征在LLM评测中监测与发现奖励黑客行为

该工作在前沿开源LLM(Kimi K3、GLM 5.2、Qwen 3.8 Max)的SWE类评测中测量奖励黑客行为的高发率,并证明由合成数据构造的简单均值差(DoM)向量能够连贯地表征奖励黑客、以接近LLM监控器的效果且近乎零成本地检测它、预测后续动作中的黑客行为,并迁移到非SWE环境发现未被预设规则覆盖的作弊行为。
arXiv

在自主实验室中基于证据的智能体处方开发

该研究提出 Andromeda 2——一个基于结构化内部实验证据进行推理并调用计算与实验工具的智能体系统,在紫杉醇自乳化给药系统(SEDDS)开发中,于匹配的 96 个处方预算下取得 50% 高 AUC 命中率(Andromeda 1 为 17%、湿实验 DoE 为 2%),并识别出 12 个满足全部四项目标产品特征(TPP)的处方(分别为 6 个和 0 个),同时通过消融实验显示获取结构化内部证据使平均 AUC 提高 34%。
arXiv

准备就绪还是尚未准备?尼日利亚医疗队伍对人工智能临床应用的准备度评估

这项横断面研究于2025年12月至2026年3月用结构化验证问卷调查了尼日利亚761名多学科、多执业场景的医疗专业人员,发现对医疗AI的总体知晓率高达92.6%,但40.9%自报知识水平低或很低、仅63.0%自感准备充分,同时92.5%愿意接受培训、78.7%支持将AI教育纳入本科课程,主要障碍为缺乏培训(84.7%)、基础设施薄弱(71.1%)、工具成本高(61.0%)、担心岗位被取代(60.6%)、伦理顾虑(52.9%)与数据隐私顾虑(52.7%),且准备度在地缘政治区之间存在显著差异、知晓度与态度在不同专业群体之间存在显著差异。
arXiv

当智能体看起来像信标:MCP 流量对 NIDS 的规避

该研究在基于 Docker 的受控测试床中,用十一种数学定义的流量画像(含 MCP 任务驱动、编排、突发、抖动、User-Agent 伪装等)在三种 TLS 条件(不透明 TLS、TLS 检查、明文)下评估 Suricata 签名匹配与 RITA 行为信标评分,发现 MCP JSON-RPC 流量在 ET Open 规则集下几乎不产生告警、RITA 信标评分一致为 0.0,且抖动注入与 User-Agent 伪装未改变传感器输出,据此提出 Agent-Native ALPN 与模式感知状态化检测规则作为改进方向。
arXiv

抵御AI代理误导性建议的量子纠错防护

该工作识别出被动综合征记录中的一种歧义会阻碍恢复方案选择,并证明在奇数距离方形环面码中,相反方向的相干X旋转会产生完全相同的被动综合征历史分布,而固定相位修正在一个符号下有益、在另一个符号下有害;通过在已知编码校准态上进行终端逻辑测量可补足缺失的符号信息,配合一个独立评估器,仅在校准不确定性与有依据的漂移界共同证明优于当前恢复时才接受更新,从而在不假设AI顾问建议正确的前提下,于模拟建议攻击中拒绝有害提案并保留有益更新。
arXiv

长寿命角色与本地推理:面向游戏NPC的增量式记忆维护

该研究在量化Qwen混合循环–注意力模型上实现了一种免训练的增量记忆维护运行时:删除被取代记录的注意力KV、在真实序列尾部计算替换记录、并保留延续的循环状态与未改动KV,实验显示独立分块组合会削弱查询条件下的记忆选择,真实尾部更新在八轮脚本化维护中保留了关键的当前状态与历史绑定,而保持原槽位的替代方案会重复一次重复扣减错误,且注意力分布接近程度并不能解释这些语义差异。
arXiv

面向双足移动机械臂的整体全身移动操作学习

该工作提出一个用强化学习训练的统一全身控制器,仅以单个6自由度末端执行器目标作为任务级指令,直接输出双足底座与六关节机械臂共14个关节的协调动作,在仿真中取得88.30%任务成功率(位置均值误差2.85 cm、P95为5.38 cm),并在真实双足平台上通过VR遥操作、扩散策略与脚本轨迹三种指令源复用同一控制器,将竖直可达范围从浮基加逆运动学基线的约38–163 cm扩展到约3–191 cm。
arXiv

随机环境中多智能体协调的社会法则:α-鲁棒性的形式化与验证

该工作把社会法则从确定性的目标驱动设定扩展到随机的、奖励驱动的多智能体环境,提出以α-鲁棒性衡量每个智能体在遵守社会法则时能保留的保证效用比例,并给出一种通过求解一系列马尔可夫决策过程(MDP)来验证鲁棒性的方法,在若干网格玩具环境上的实验显示:当动作成功概率为1时,平行车道、对向车道以及带顺时针社会法则的交叉场景可达到α=1的鲁棒性,而强制慢速等社会法则并不总能提升保证效用。
arXiv

用超图表示学习与图条件扩散实现对撞机事件的综合重建

该工作提出 VyPER 这一几何学习框架,把对撞机事件表示为具有物理启发式拓扑的超图,将“把测量到的喷注与带电轻子分配给母粒子”的超边监督分类与“预测未被测量的中微子运动学”的扩散模型结合,并通过联合损失函数在同一框架内同时优化两项重建任务,在多个质子-质子碰撞过程中与既有解析方法和机器学习重建方法进行比较,表明在多种标准模型物理过程中可实现准确的事件重建。
arXiv

PhysVGGT:单张图像的前馈稠密物理属性估计

PhysVGGT 将物理属性估计表述为稠密逐像素预测问题,用视觉几何 Transformer 提取几何感知 token,再经稠密分支预测摩擦系数、Shore 硬度、杨氏模量和密度的逐像素图、经全局分支预测物体级质量,在单张 RGB 图像上单次前向完成,在 ABO-500 上取得最优质量估计、在分布外的 NeRF2Physics 真实基准上取得最优摩擦与硬度结果,推理延迟 0.13 秒、比此前最优方法快 27 倍。
arXiv

专家混合语言模型中专家的高阶剪枝

该工作提出 HOPE,一种二阶专家剪枝目标:在校准阶段记录每层专家对的交互矩阵 F,并将其作为二次规划求解以选择剪枝集合,理论上证明 REAP 等一阶方法是忽略交互项的特例;在三个前沿 MoE 模型(最高 122B 参数)、两套校准集与多个基准上,HOPE 在多数条件下取得最佳平均排名,50% 剪枝时平均排名 1.58(次优方法 REAP 为 2.42),在智能体编码任务上最高提升 +6.1%。
arXiv

超越结果:面向高效智能体基准评测的双视角关系学习

该工作分析五个智能体基准的大规模执行轨迹,从十二个可观测统计量中筛选出六个与最终成绩系统性相关的过程信号,并提出 DualViewEval,同时建模结果关系与过程关系来学习固定规模的最小子集并预测全基准分数,在五个基准上均取得最佳结果,仅用 20 个任务即在 APEX-Agents 与 BFCL 上实现 24×–40× 压缩,相对最强竞争者降低 MAE 14.5%–28.2%,并在 SWE-bench Verified 上相对 EssenceBench 将 Kendall's τ 提升最多 7.2%。
arXiv

人权值多少钱?ECtHR-NPD:预测非金钱损害赔偿金额的基准

该工作构建了 ECtHR-NPD,一个包含 14,575 份欧洲人权法院判决、以名义欧元记录案件级非金钱损害赔偿(NPD)金额的基准,采用按时间划分的训练/验证/测试集与 ID/OOD/Challenging 三种诊断视图,并系统评测了常数预测器、梯度提升树、检索方法、微调编码器语言模型、提示式解码器语言模型与知识增强智能体六类方法,结果显示最复杂的语言模型与智能体方法并未稳定超越最强的特征基线,所有方法族在识别零赔偿案件与校准高额赔偿上都表现困难。
arXiv

面向密集健康叙事的结构化主张级话语表示

该工作提出以(原子主张、主题方面、立场、六维语用属性)元组刻画密集健康叙事,构建覆盖GLP-1减重药、睾酮替代疗法、胶原蛋白补充与间歇性禁食四个领域、来自60个视频的1191条人工标注主张的基准,并系统评测大语言模型在不同话语上下文设置下的结构化话语预测表现。
arXiv

面向大型数据中心负荷的电网感知动态规范设计

该研究针对大语言模型训练负荷的两类显著行为——作业启动与终止时的突变爬坡(引发暂态频率偏移)以及训练期间持续的周期性振荡(导致振荡稳态行为),提出电网感知的动态规范框架:对爬坡负荷证明节点转子频率可由惯量中心(COI)频率准确近似,并推导其最低点与频率变化率(RoCoF)的解析表达式,从而确定满足给定频率限值的爬坡时间与稳态负荷需求的可允许组合;对振荡负荷推导其傅里叶系数的频谱规范,证明可允许系数集可近似为多面体,并进一步用其最大体积内接椭球给出紧凑表示且证明该椭球轴对齐;在 WECC 179 节点系统上的数值测试表明所得规范对更高阶非线性动力学仍然有效。
arXiv

用Fisher-Rao几何重新界定防止模型坍塌所需的人类数据比例

该工作把生成模型的迭代训练建模为概率单纯形上的闭环随机过程,改用Fisher-Rao度量而非欧氏度量分析其动力学,推导出随维度增大仍不失效的收缩与不变性界,并给出保证收敛到Fisher-Rao球的人类与合成数据比例阈值,结论是有效所需的人类数据比例高于此前欧氏分析所暗示的水平。
arXiv

ASLEval:衡量 LLM 智能体会话中的隐私暴露位移

该工作提出“隐私暴露位移”概念与 ASLEval 框架,在会话开始前预先登记隐藏目标集、授权关系与声明的可见出口,用目标盲探针智能体与事后目标对齐裁决,比较局部评估代理与全会话可见暴露;在多个企业式环境与两套独立运行时中观察到三类规律:仅看预期出口会漏掉可见出口并集所恢复暴露的 46.9%,攻击者自报同时存在遗漏与高误报,且模式对齐的内部证据在请求/探针层面通常先于可见暴露,而削减模型可见返回虽改变该路径却可能使正常任务成功率归零。
arXiv

PersonaPath:面向知识中心的个性化学习路径规划基准

该工作提出知识中心(KC)个性化学习路径规划任务,并构建 PersonaPath 基准,将 2,000 个细粒度学习者画像与覆盖 77 个学科、347 本教材、1,751 个单元、4,092 个概念的分层知识图谱配对,用于评测大语言模型在给定学习者画像、掌握状态与先修知识结构下决定下一步应学哪本教材、哪个单元、哪个概念的能力;对代表性大模型的评测显示,最强模型在基础教育场景的最终通过率仅为 29.5%,且主要瓶颈在于适配性,没有任何模型在针对个体学习者定制路径方面超过 44.7%。
arXiv

可解码但被错误路由:稀疏特征揭示视觉语言模型在有害模因检测中的读出缺口

该研究用稀疏自编码器、角色条件探针、因果干预与恢复实验,在 Gemma-3 与 Qwen3.5 上跨六个有害内容基准(并补充西班牙语与印地语-英语混合语评估)区分“模型未表征证据”与“已表征但未路由到输出”两种失败,发现稀疏读出在全部六个二分类任务上均优于原生预测(Qwen 平均 0.740 对 0.432,Gemma 从 0.532 升至 0.714),探针判别方向与输出路由方向可分离,仅校准的路由恢复平均缺口的 93.3%,探针蒸馏 LoRA 可改善原生预测但共享多任务适配带来负迁移,且信号超出英语、不能仅由所提供 OCR 解释、并依赖成对视觉证据。
OpenAI

帮助老年人安全地在日常生活中使用人工智能

OpenAI 与 AARP 合作,将在美国 10 座城市为 1,000 名老年人提供免费的 ChatGPT 实操工作坊,帮助他们安全地建立实用的人工智能技能。
Nature News

用AI追问衰老速度:一个面向长寿研究的专用模型与评测体系

《Cell》报道的一项工作构建了面向衰老生物学的专用大语言模型系统,配套17项评测任务与整合研究工具和AI智能体的交互界面,并用这些基准比较了专用模型与OpenAI、DeepSeek等更大规模通用商业模型,结果显示在多数但并非全部测试中,衰老领域定制模型表现更优。
Nature News

风险还是稳妥?神经元“拔河”揭示大脑如何在趋避冲突中做出选择

该报道介绍了一项发表于《自然·神经科学》的研究:研究者直接记录六名受试者眶额皮层(OFC)的电活动,发现两个相邻OFC区域在权衡风险与回报时呈实时反相关——一个区域在受试者选择追求回报前更活跃,另一个在受试者选择回避风险前更活跃,而在困难抉择中信号会在两区间快速切换后才落定。
Nature News

人类监督下的智能体式AI:从假设生成到实验辅助的药物重定位

该研究开发了RepurAgent——一个由监督智能体与规划智能体协调研究、预测、数据、报告四个子智能体、并采用人在回路设计、情景记忆与检索增强生成的分层多智能体系统,在急性髓系白血病、回顾性COVID-19抗病毒筛选和多种硫酸酯酶缺乏症三个场景中验证其可贯穿药物重定位生命周期,分别获得专家盲评认为比普通LLM基线更具新颖性与机制可信度的候选、在无预设阈值下对化合物排序达到最高0.99的AUC-ROC并标记出人工复核遗漏的混杂因素、以及从5000个化合物中优先选出81个高置信候选并获得领域专家佐证。
Nature News

AI时代的数学署名之争:OpenAI宣称攻克纳维–斯托克斯问题引发的讨论

《自然》新闻报道称,OpenAI于9月8日宣布其AI模型解决了流体力学中的纳维–斯托克斯问题,并用Lean语言验证了证明,但数学家Tristan Buckmaster与Levent Alpöge表示他们此前已用OpenAI和Anthropic工具研究该问题,Andreas Thom也提出其关于非sofic群的讨论可能与OpenAI相关成果思路相近,由此引发25位菲尔兹奖得主联名公开信及学界对AI时代学术署名与训练数据来源的广泛讨论。