跳到主要内容

日报

AI 与科学前沿 · 2026-09-27

仅汇集当天已送达公开发布边界的内容。

IEEE Spectrum

IBM 退休软件工程师 Ralph Earle 以诗作《工程师的诗》把代码翻译成界面之美

这篇短文呈现了 IBM 软件实验室前技术编辑、后任高级软件工程师的 Ralph Earle 的一首诗《工程师的诗:UI 设计师之梦》,诗中把写代码、逐像素构建互联网界面比作把枯燥代码翻译成美,并表达把神圣愿景翻译成通用通信协议、让光片如钻石般落在网络群山上的愿望;文末另附作者小传,说明他 1990 年入职 IBM 罗利软件实验室、2017 年以高级软件工程师身份退休,合著过《Enterprise Computing with Objects》,退休后出版两部诗集并三次获 Pushcart Prize 提名。
bioRxiv

研究团队构建覆盖21种成人组织的单核多组学图谱,解析459,856个转录组与染色质可及性图谱并识别161,270个新调控元件

该研究构建了一个单核多组学图谱,包含来自21种成人组织和4名供体的459,856个转录组与染色质可及性图谱(其中160,688个细胞核为配对测量),解析出9个细胞谱系、61种宽泛细胞类型和313个亚群,识别出1,085,062个候选顺式调控元件(含161,270个ENCODE未收录的新元件),并利用该数据训练序列到功能模型,对548,656个精细定位变异预测染色质可及性效应,识别出18,133个高效应变异(含1,120个广泛活跃变异)。
发表出处待核验

这篇博士论文提出把因果机器学习落地临床的三项方法创新与一个设计框架,并用物理治疗剂量案例检验连续治疗模型

这篇博士论文围绕如何把因果机器学习用于真实临床实践,沿三条线索展开:在临床情境下的二值治疗效应估计中识别出八个直接影响治疗效应估计的关键决策点并提出结构化设计框架;针对反事实预测难以验证的问题,提出一种把平均模型预测锚定到可用随机或真实世界临床试验数据经验验证的组级量的新方法,并展示信息瓶颈正则化可降低反事实误差界、提升治疗效应估计表现;在连续因果机器学习方面以物理治疗剂量对功能独立性的影响为具体医疗用例开展研究;在元强化学习方面提出一种利用多数据集学习更稳健、更可泛化策略的新算法。
International Journal of Modern Science and Research Technology

叙事综述:生成式AI卸载认知可提升当下表现,但表现与学习出现分离,是否使用AI不如卸载哪些功能关键

这篇叙事综述检索了截至2026年9月5日的同行评审GenAI研究以及认知卸载的基础研究,发现证据不支持GenAI对人类认知有简单正面或负面效应:GenAI支持的记忆检索、加工与学习等认知卸载可降低所需认知容量并在多种任务上维持高表现,但同样的卸载有时会降低后续编码质量,近期GenAI研究显示出一致的“表现—学习分离”,即支持可用时的高表现向无支持后测的迁移通常很小、不存在甚至为负。
发表出处待核验

博士论文整合六国居家照护数据:中高强度身体活动与居家照护老人功能状态、健康结局和死亡风险改善相关

这篇博士论文依托欧盟I-CARE4OLD项目,第一部分梳理了非药物干预(NPI)的定义与使用现状——系统综述显示文献中NPI定义高度异质且多为负面表述,六国居家照护数据显示部分有证据支持的干预(物理治疗、作业治疗、心理社会干预、社会参与)使用不足而身体约束使用相对频繁;第二部分利用荷兰与加拿大安大略省的纵向真实世界数据,采用倾向性方法、广义估计方程以及结合因果机器学习的靶试验仿真,发现中度和更高水平的身体活动与居家照护老人功能状态、健康相关结局和死亡率的改善相关。
IJIS - Indonesian Journal On Information System

七种算法在 PLN Mobile 的 SPKLU 评论情感分析中,MLP 以 89.16% 准确率但 59.42% 宏 F1 胜出

该研究从 Google Play Store 抓取 PLN Mobile 中 EV Charging/SPKLU 功能的用户评论,以评分作为弱标签进行情感标注,在训练集上按各算法特性施加类别权重以应对类别不平衡,并比较 Logistic Regression、SVM、Naive Bayes、MLP、RNN、BiLSTM 与 DistilBERT 七种分类算法,结果显示 MLP 在验证集上取得最高宏 F1(67.80%)并被选作最终测试模型,在 286 条测试数据上达到 89.16% 准确率与 59.42% 宏 F1,说明整体分类表现较高但各情感类别之间表现尚不均衡。
JURNAL PESISIR DAN LAUT TROPIS

机器学习偏差订正把 Ina-Flows 海表温度预报误差在 Karimun Jawa 降低 29.83%、在 Bira 降低 26.10%,且最优算法随地点不同

该研究用 MAWS 观测评估 BMKG Ina-Flows 海表温度预报的偏差,并在 Karimun Jawa 与 Bira 两个站点比较 SVR、LSTM、Bi-LSTM 三种机器学习偏差订正算法,发现 Ina-Flows 在两处均存在暖偏差,Karimun Jawa 以 LSTM 最优(RMSE 0.207、MAE 0.182、MBE -0.171,RMSE 降低 29.83%),Bira 以 Bi-LSTM 最优(RMSE 0.218、MAE 0.173、MBE 0.011,RMSE 降低 26.10%),说明订正效果依赖地点、算法选择需依据本地验证。
arXiv

Reflex-Guard 用本地稠密语义嵌入把提示安全过滤压到 37.6 毫秒,并在 30,568 条样本上取得 95.9% 有害提示召回

该工作提出 Reflex-Guard,一个本地运行的轻量级 LLM 提示安全护栏,结合越狱感知预处理、紧凑句向量嵌入与七个快速二分类器,在来自五个互补来源、共 30,568 条样本的平衡数据集上实现 95.9% 有害提示召回与 37.6 毫秒端到端延迟,快于 Llama Guard 2(255 毫秒)和 SafeDecoding(723 毫秒),默认阈值下可检出 100% 的 GCG 后缀攻击与 Base64 编码提示,而 DrAttack 结构化提示需将阈值降至 0.03 才能获得最佳检测效果。
arXiv

TP-CRIV 让无白盒无 API 的第三方仅凭黑盒推理接口就能对 AI 模型做挑战—响应身份核验

该工作提出第三方挑战—响应身份验证框架 TP-CRIV,针对验证者既无白盒也无 API 访问、只能通过可疑部署服务的普通黑盒推理接口交互、且不需要服务提供方协议配合的场景,在全新未披露要求与网络隔离下获取经验证据,判断声称方是否本地拥有符合预先声明身份的模型;作者用基于概率控制的见证生成方法为 CNN 图像分类器实例化该框架,在十个 ImageNet 预训练 TorchVision 模型上实验,显示清晰的同模型/跨模型分离,并可用独立校准的阈值实现有限次挑战的验证。
arXiv

LiveMathematicianBench 用 arXiv 新论文构建研究级数学推理基准,最强模型仅得 43.5%,替换抗性评测下 Gemini-3.1-pro-preview 跌至 17.6%

该工作提出 LiveMathematicianBench,一个从模型训练截止之后发表的近期 arXiv 论文中构建的动态多项选择题基准,用于评测研究级数学推理,并引入十三类定理类型逻辑分类、由证明草图引导的干扰项生成流程以及替换抗性机制;评测显示基准远未饱和,最佳模型 Gemini-3.1-pro-preview 仅达 43.5%,在替换抗性评测下 GPT-5.4 最高为 30.6%,而 Gemini-3.1-pro-preview 降至 17.6%,低于 20% 的随机基线,同时双模式协议显示提供证明草图可带来一致的准确率提升。
arXiv

DMA 直接近似因子到变量消息,证明边缘 KL 受消息 KL 约束,并据此构建无需学习率的贝叶斯神经网络推理

该工作提出直接消息近似(DMA),不再像期望传播(EP)和变分消息传递(VMP)那样近似因子图每条边上的边缘分布,而是直接近似因子到变量的消息,对可归一化因子定义一致性条件(当其余入消息均为 Dirac delta 时要求精确),证明了一个主定理:在消息为 proper、图任意的条件下,用消息 KL 界定边缘 KL,并给出三条结构性推论——Dirac 输入一致性、无需 EP 式内层迭代、不产生负精度消息;此外为乘积因子固有的非 proper 反向消息证明了互补的 O(1/r^2) 保证;作为具体实例,推导了乘积因子与 leaky-ReLU 因子的显式 DMA 消息,组装出每个训练样本一次前向/后向扫描、且不含梯度学习率超参数的贝
arXiv

SciMuse 用 5800 万篇论文知识图谱加 LLM 生成个性化科研想法,100 余位研究组长对 4400 余条想法打分均值仅 2.40(5 分制),但 24.9% 获 4 分或 5 分

作者提出 SciMuse,用包含 5800 万篇论文的知识图谱与大语言模型生成个性化科研想法,并邀请超过 100 位横跨自然科学到人文领域的研究组长对 4400 余条想法按兴趣程度评分,结果显示专家评分整体温和(5 分制均值 2.40,最常见评分为 1),24.9% 的想法获 4 分或 5 分;用知识图谱选出的概念对并未比仅用标题的 GPT 基线提升专家兴趣评分,高引用预测的概念对甚至呈现弱趋势(1.94σ)低于随机概念对;但图谱特征可用于控制想法属性,且基于图谱特征的监督神经网络与基于 LLM 的零样本排序都能预测想法兴趣度。
arXiv

MorphIK用形态条件化流匹配为未见过的6至9自由度机器人求解逆运动学,精度约5厘米并可经优化降至亚毫米

MorphIK是一个流匹配模型,用transformer编码机器人的形态与目标位姿,再以该编码条件化流匹配头从噪声生成关节位姿,从而对训练中从未见过的转动关节运动链求解逆运动学;它仅用程序化生成机器人的纯合成数据训练,在6至9自由度的未见真实机器人上达到约5厘米精度,作为先验配合阻尼最小二乘优化可在一步后把误差降到1厘米以内、多数情况下三步后达到亚毫米级,并能高效采样零空间以对同一位姿给出多种构型。
arXiv

NOVQS 用多个浅层参数化量子电路的线性组合,在氢链和氮分子模拟中匹配或超过单个深层电路

该工作提出非正交变分量子模拟(NOVQS),用多个参数化量子态的线性组合来同时处理实时间和虚时间演化,并针对二次量子化电子结构哈密顿量设计了浅层硬件友好拟设与资源高效的矩阵和向量测量方案,误差分析与资源估计一并给出;对氢链和氮分子的数值模拟显示,一组浅层甚至单层参数化量子电路可以匹配或超过变分量子模拟中一个深得多的电路,并揭示电路数量与深度之间的权衡。
arXiv

ProGS 用基于模型的证明草图组织形式化建模,在 27 个形式系统基准上提升语法有效性、演绎可验证性与行为正确性

该工作提出 Proof-Sketch-Guided Formal Model Synthesis(ProGS),一种以基于模型的证明草图为中心的自动形式化方法:草图把目标形式系统的证明结构表示为树,内部节点对应情况划分与归纳推理步骤,叶节点对应实现各子目标的具体状态转移事件,LLM 负责生成与修复这些草图,验证失败被映射回特定节点与子树以提供结构化修复指导;在 27 个形式系统基准上的评估显示,ProGS 在语法有效性、演绎可验证性与行为正确性上优于当前最先进的智能体式形式化建模方法。
arXiv

研究提出 CDP 诊断指标,发现 DeepPersona-Inspired 提示在四个模型与两个调查领域中均出现最强文化扁平化

该研究提出文化分歧保持度(CDP)这一基于一次性人工校准、对参考数据依赖较轻的诊断指标,用于识别跨国调查模拟中跨国差异被压缩(文化扁平化)或被放大(文化漫画化)的现象,并在四个大语言模型骨干、三种基于人格设定的提示方法以及世界价值观调查(WVS)与大五人格测试两个调查领域上开展实验,结果显示传统保真度指标与 CDP 之间存在系统性差异:在受控实验中,当跨国差异被削弱或放大时 CDP 单调变化而 JSD 变化相对较小;在对真实模型生成结果的审计中,DeepPersona-Inspired 提示常被传统保真度指标看好,却在每个模型—领域组合中都表现出最强的扁平化。
arXiv

ArGuard 共享任务:58 支队伍注册、35 支参赛,阿拉伯语表情包与 LLM 提示词有害内容检测最佳系统 macro-F1 达 0.823/0.419/0.984/0.790

ArGuard 是一个针对阿拉伯语有害内容检测的共享任务,包含两条赛道:Track A 面向阿拉伯语表情包的多模态仇恨检测,Track B 面向阿拉伯语 LLM 安全评估的有害提示词检测;共有 58 支队伍注册、35 支参加最终评测、27 支提交系统描述论文,参赛队伍探索了 AraBERT、Jais、Qwen3-VL 等模型,最佳系统在 A1、A2、B1、B2 上分别取得 macro-F1 0.823、0.419、0.984、0.790,其中 A2 的细粒度表情包分类因标签稀疏与训练-测试分布偏移而最具挑战。
arXiv

综述梳理大语言模型如何以代理模型与智能体两种模式介入纳米光子学设计流程

这篇综述考察大语言模型如何为既有纳米光子学数值工作流加入语义接口、代码生成与工具编排,并把相关方法归纳为两种运行模式:把结构—光谱映射当作语言任务的代理模型,以及已被证明能生成代码、编排部分仿真步骤并支持闭环优化的智能体系统;文章还从经典神经网络到基于Transformer的模型梳理了发展脉络,并简要展望了材料科学与无线通信等跨领域应用以及具备物理感知能力的下一代多模态基础模型。
arXiv

27名中学教师在教师端聊天机器人创作工具中配置教学意图,日志评估显示回应性对齐88.9%、人设81.5%,而规则70.4%、目的59.3%

该研究在专业发展工作坊中让27名中学教师使用一个面向教师的聊天机器人创作工具,结合焦点小组访谈、配置日志与交互日志分析教师如何把教学意图转化为聊天机器人配置以及配置在多大程度上反映为机器人行为,发现教师把聊天机器人设想为可提供差异化支持、扩大求助渠道并在教师设定边界内保留学生思考的教学支架,配置中Purpose主要承载教学目标与内容重点而Rules更多规定教学行为、护栏与学习者适配,基于日志的评估显示回应性(88.9%)与人设(81.5%)的对齐强于规则(70.4%)与目的(59.3%),表明仅有可配置控件并不保证教学忠实度。
arXiv

学习型框架让缩放液压挖掘机连续自主挖掘,单次循环平均载荷达6.52 kg,高于固定挖掘的2.68 kg

该工作提出一个面向连续自主挖掘的学习型框架,将地形感知的目标选择与强化学习和模仿学习控制器结合:共享的任务条件RL策略负责航点引导的接近与负载运输,IL策略从专家演示中学习基于视觉的挖掘与提升,挖掘目标由LiDAR高程图选出并转换为铲斗尖端航点;系统部署在带多模态传感与闭环执行器控制的缩放液压挖掘机上,离线回放与物理实验显示目标选择更一致、局部运动时间更短、载荷更高,学习型挖掘策略每完成循环平均载荷6.52 kg,而Fixed Dig为2.68 kg,三次五铲运行进一步展示了在持续变化的料堆几何下连续自主挖掘。
arXiv

TabSieve 用「先选证据再预测」的框架,在 75 个分类表和 52 个回归表上把分类平均提升 2.92%、回归平均提升 4.45%

作者提出 TabSieve 这一「先选后预测」框架:给定一张表和一行查询,先选出少量有信息量的行作为证据,再在所选证据条件下预测缺失目标;为支撑该能力,他们用强教师模型从 331 张真实表合成并严格过滤出 TabSieve-SFT-40K 训练数据,并提出 TAB-GRPO 强化学习方案,用分离的奖励联合优化证据选择与预测正确性,并通过动态任务优势平衡稳定混合的回归与分类训练;在 75 张分类表和 52 张回归表的留出基准上,TabSieve 在各 shot 预算下持续提升,相对次优基线平均提升分类 2.92%、回归 4.45%,分析显示模型把更多注意力集中在所选证据上,从而对噪声上下文更稳健。
arXiv

CANOPY 用随机路径探针在线检测平滑性违背,在路由、top-k 识别、测试时搜索、缓存与提示裁剪上以同等预算取得更好结果

该工作提出 CANOPY,一种多保真度树状 bandit 方法:它用廉价的随机路径探针构建局部聚合偏差的在线证书,把昂贵的叶子评估导向证书检测到平滑性违背的单元,从而不再预先假定全局平滑先验;作者给出固定预算与遗憾保证,其额外代价随不连续点数量可加,并在无违背时恢复平滑树速率、在违背密集时趋近结构盲搜索;在路由、top-k 识别、测试时搜索、缓存与提示裁剪中,CANOPY 在匹配预算下持续提升表现,包括在 1000 模型池上 top-10 召回率提高 2.9 倍、在 SWE-bench Verified 上比 best-of-N 多解决 1.6 倍问题、前缀缓存下中位首 token 时间降低 3.6 倍。
arXiv

GPT模型修Codeforces错误提交时改动行数多于人类补丁,且从零重写比打补丁解出更多题

该工作从Codeforces两位用户收集约3000份提交,把每份错误提交与对应的人类修复配对,以错误解与人类修复之间的相似度作为基线,在gpt-5-nano、gpt-5-mini、gpt-5.1三个OpenAI GPT模型上评估其生成修复的质量,并用Codeforces-R1数据集检验生成解是否正确;结果显示LLM相比人类修复倾向于改动更多行,有时直接生成全新解,且在允许从零生成时比修补错误提交解出更多题目,即使这些提交已接近人类补丁。
arXiv

STAM-ASR 用说话人-时间锚定与记忆扩展预训练 AudioLLM,在 AMI、ICSI、LibriCSS、NOTSOFAR-1 上验证多说话人识别

该工作提出 STAM-ASR,一个在已预训练 AudioLLM 之上扩展的轻量框架,不依赖外部说话人分离系统,而是直接从 AudioLLM 中间特征学习说话人活动与说话人感知表示,为语义表示提供显式的“谁在何时说话”线索,并维护固定大小的说话人记忆与会话记忆以跨轮次携带上下文,在 AMI、ICSI、LibriCSS 和 NOTSOFAR-1 上覆盖近讲、远场、重叠与跨域条件进行评估,报告结果显示说话人-时间条件化与记忆带来互补收益,而参考说话人活动与预测说话人活动之间的差距表明稳健的说话人跟踪仍是关键挑战。
arXiv

逐帧早退在端侧语音增强中是否划算:动态深度与静态模型在STM32N6上落在同一延迟-质量前沿,策略每帧仅26微秒

该工作对一个因果语音增强模型的每个中间深度都施加监督,并微调各输出头以保证更深输出不劣于更浅输出,由此得到一族比同预算从零训练的等规模模型更帕累托高效的静态模型(同等算力下PESQ最高提升0.11,以少30%算力匹配最佳PESQ),并在STM32N6微控制器上量化到int8后测得动态增强器与静态模型落在同一延迟-质量前沿,配套Cortex-M55上策略每帧仅26微秒、拆分NPU图带来2.2%延迟开销。
arXiv

冻结的Sapiens姿态基础模型无需攀岩训练即可检测攀岩支点使用,事件F1达90.2%

该工作提出一种无需攀岩专项训练的方法,直接使用冻结的Sapiens姿态基础模型的指尖与脚趾关键点,结合逐帧与标注支点的邻近判定、逐肢互斥和短时持续性规则来检测攀岩者使用了哪些支点及何时使用;在The Way Up数据集(22段视频、10名运动员、两条路线)上,留出划分的事件F1为90.2%,留一参与者交叉验证为89.8%,全部22段视频在任意时间重叠下为79.9%,脚点表现最佳(整体F1 89.8%,留出96.6%),并在相同协议下于每个时间阈值上超过对YOLOv8-pose与ViTPose流程的复现,且严格计时下优势扩大;消融显示稠密基础特征变化门控与身体部位分割均带来负面影响,而由自动预测计算的
arXiv

对 2,042 个 Python 仓库的跨操作系统可移植性实证分析发现 11.2% 项目存在 OS 相关测试失败,并给出 7 类失败分类与 LLM 修复评估

该研究对 2,042 个开源 Python 仓库开展跨操作系统可移植性实证分析,通过跨 OS 测试重执行(500 个项目,11.2% 出现 OS 相关测试失败)与 240 条 GitHub issue 人工分析(确认 102 个真实可移植性问题,涉及另外 95 个项目),构建了包含 7 个主类别、24 个子类别、15 个诊断特征和 4 种系统性修复模式的分类体系,并评估现有静态分析工具支持有限、而大语言模型在结构化指导下识别问题准确率为 40-79%、生成修复成功率为 50-77%,同时通过 33 个贡献的 pull request(17 个被合并、零个被拒绝)验证了实用性。
arXiv

在一家大型科技公司多团队中实地部署持续在线的主动式AI“队友”后,研究者观察到人机工作边界在协作规则、非人行动者关系与信任分配三方面持续被协商。

本文对一家大型科技公司多个团队中部署的持续在线、主动式AI代理“队友”进行了实地定性研究,发现人机工作场所的边界处于流动状态,并在三方面引发断裂与协商:人类协作工作流中的隐性规则、这一新非人行动者的关系边界,以及信任与人类能动性的再分配;作者据此提出一项旨在有意保留人类能动性的研究、设计与组织议程。
arXiv

把自主AI智能体的授权写成可密码学验证的关系 R_CVA,并用 Groth16 zk-SNARK 做出可执行概念验证

该研究提出一个可证伪的假设:智能体授权可形式化为一个可密码学验证的关系 R_CVA,它把智能体主体、具体授权请求、执行上下文与适用策略的满足情况联合绑定,同时选择性保护私有授权属性的机密性;作者给出 CVA 的初步形式化抽象、一组候选安全属性(授权可靠性、主体绑定、请求绑定、策略绑定、抗重放),并在 Groth16 zk-SNARK 构造上实现了一个可执行的零知识概念验证,同时把身份绑定、授权请求绑定与运行时执行绑定之间的结构性分离正式化为安全智能体系统设计中的核心开放问题,并提出可证伪的研究议程。
arXiv

MemGuard-Alpha 审计发现:MIA 污染分数在固定日期下判别力降至 0.487–0.537,且无过滤变体在对称交易成本下跑赢未过滤集成

作者提出 MemGuard-Alpha,包含融合五种成员推断攻击(MIA)方法与时间邻近特征的复合污染分数,以及利用模型训练截止时间差异的跨模型记忆分歧,并在七个 LLM(124M–7B)、50 只标普 100 成分股、42,800 条提示与 299,600 条提示-模型 MIA 分数(2019–2024)上审计这两者,得到三项负面结果:时间邻近特征以 ROC-AUC 1.000 完美恢复样本内标签(因其是定义变量的单调变换),MIA 分数的判别力主要来自模型间规模差异(固定日期下原始分数 AUC 高达 0.99,但三种模型内归一化后降至 0.487–0.537),且在对称交易成本下没有任何过滤变体改善风险调整后表现、无一获得显
arXiv

146个单壁碳纳米管结的自动化计算库揭示:平均手性角主导透射台阶,金属/半导体属性主导能隙

该工作构建了146个单壁碳纳米管—单壁碳纳米管结的计算库,用分子动力学、紧束缚理论、Peierls磁耦合与非平衡格林函数组成的自动化流程计算磁输运,再用机器学习分析,发现平均首次透射台阶值主要由两根纳米管的平均手性角决定,而结的能隙主要由组成纳米管的金属或半导体属性决定,温度总体压低平均透射并减小提取的能隙,垂直磁场对透射的影响远强于对能隙的影响,干涉驱动输运的特征在300 K下仍可见,半导体—半导体结保持最大能隙但在进入导电区后透射可媲美或超过金属结。
arXiv

把音频描述拆成"说什么、何时说、怎么说"的约束优化后,该系统在 REFRAMED 上刷新了叙事问答与时序指标的最优结果

该工作把音频描述(AD)生成形式化为一个关于"描述什么视觉信息、在对话间隙的何时插入、以及如何在有限时间内压缩表达"三个耦合决策的约束优化问题,提出一个混合系统:用大语言模型提出并定位视觉元素、估计其对叙事的显著度并生成压缩表述,再用混合整数线性规划在场景层面联合选择与排布描述并满足时间约束;在面向电影真实 AD 的 REFRAMED 基准上,该方法在"描述什么"和"何时描述"上优于提示式大语言模型,在叙事问答与时序相关指标上取得新的最优结果,消融显示显式时间约束带来排布增益、显著度估计决定叙事有用内容的保留量,改进集中在时序与叙事指标而非 n-gram 重叠,且与专业描述者之间仍有明显差距。
arXiv

OncoVision 用注意力多模态训练框架,在六位放射科医师配对评估中把阅片时间最多缩短 61%,并提升诊断信心

OncoVision 是一个特权信息训练框架:训练时同时使用乳腺 X 线摄影图像与临床特征,推理时仅依赖乳腺摄影图像,采用基于注意力的编码器-解码器骨干,联合分割四个感兴趣区域(肿块、钙化、腋窝所见、乳腺组织)并预测十项结构化临床特征(含 BI-RADS 分类),其分割准确率超过 nnU-Net 基线;作者提出 Independent 与 Dependent 两种晚期融合策略,在训练中整合影像、影像组学与临床信息,并从预测掩膜提取形状、强度、纹理等影像组学描述符以补充 CNN 表示;在六位委员会认证放射科医师参与的回顾性多阅片者研究中,配对阅片辅助评估显示该工具与初级和资深放射科医师更高的诊断信心相关,阅片时间最多减少
arXiv

SkillGym 把人类技能转成可验证训练环境,让 35B 模型在 SkillsBench 上以 51.47% 超过 Claude Sonnet 4.6 等报告分数

SkillGym 提出一个把人类编写的 agent 技能转化为可执行、可验证训练环境的框架,通过技能到任务流水线生成具体任务、用代码检查器验证结果并以对比执行衡量技能依赖,构建并发布 12 个类别共 2756 个环境和 8364 条成功轨迹(平均 49 次工具调用、超过 60k 文本 token),支持在已验证工作流上做监督微调与基于结果奖励的强化学习;在 Claude Code 下,监督微调使 Qwen3.5-35B-A3B 在 GDPval-AA v2 上提升 199 Elo、在 Terminal-Bench 2.1 上提升 19.10 个百分点、在 SkillsBench v1.1 上带技能与不带技能分别提升 28.13 和 12.38 个百分点,其 35B 的
arXiv

STAM-ASR 用说话人-时间锚定与记忆扩展预训练 AudioLLM,在 AMI、ICSI、LibriCSS、NOTSOFAR-1 上实现多说话人识别

STAM-ASR 是一个轻量框架,它在不依赖外部说话人分离系统、也不做显式语音分离的前提下,直接从预训练 AudioLLM 的中间特征中学习说话人活动与说话人感知表示,为语义表示提供“谁在何时说话”的显式线索,并维护固定大小的说话人记忆与会话记忆以跨轮次携带上下文;在 AMI、ICSI、LibriCSS 和 NOTSOFAR-1 上覆盖近讲、远场、重叠与跨域条件进行评估,报告结果显示说话人-时间条件化与记忆带来互补收益,而参考说话人活动与预测说话人活动之间的差距表明稳健的说话人跟踪仍是关键挑战。
arXiv

TIDE 把推理中产生的隐藏状态直接用于草稿模型在线适配,在真实负载上实现最高 1.66 倍吞吐并挽回静态草稿模型失配时的性能下降

TIDE 是一个内嵌于服务引擎的框架,它把目标模型推理过程中产生的中间隐藏状态复用为草稿模型在线适配的训练信号,从而避免额外的目标模型计算与服务开销,并配合自适应运行时控制仅在有利时启用推测与草稿训练、把推理与训练映射到合适的 GPU 类别;在多样真实负载上,TIDE 相对无推测基线取得最高 1.66 倍吞吐,在静态草稿模型导致吞吐下降的失配负载上恢复性能,相比既有草稿训练方法把训练时间最多缩短 3.02 倍、存储需求最多降低 24 倍,并在异构 GPU 集群上把系统吞吐最多提升 1.22 倍。
arXiv

SEEK 将搜索评估标准外化为可路由技能库,在快手短视频搜索中提升列表级质量评估与归因诊断

该工作提出 SEEK(Skill-routed Evaluation with Evolvable Knowledge),把具体的搜索评估标准外化到一个技能库中,为每个查询—结果列表对动态路由相关技能,并用任务适配的列表级评估器给出页面级判断与失败模式归因;两阶段训练流程使评估器将评估标准与人类偏好对齐,而带重放门控的技能库允许把反复出现的评估知识缺口纳入其中而无需重新训练模型;在工业短视频搜索上的实验显示,SEEK 提升了列表级质量评估准确率并在归因诊断上取得显著进展,且已在日活跃用户超过 4 亿的快手部署,显著提升了线上搜索评估的规模与质量。
arXiv

Qwen-Planner-Agent 在 MobilePA-Bench 上取得所有被评估模型与系统中的最佳总体表现,并在工具使用、记忆、技能与子智能体协同上超越其基座模型

该工作构建了闭环 AI-for-AI 框架下的 Qwen-Planner-Agent,通过共享的“动作—反馈—验证”契约把数据生产、模型训练与部署串联起来:AI for Data 建立人工把关的智能体数据飞轮,AI for Training 结合监督式规划冷启动与混合环境在线智能体强化学习并提出 CARE 以降低推理与工具使用成本,AI 驱动模型与运行框架协同演化;结果显示该智能体在 MobilePA-Bench 上取得所有被评估模型与系统中的最佳总体表现,并在工具使用、记忆、技能与子智能体协同方面优于其基座模型,同时在非移动智能体基准上有所提升且大体保持通用能力。
arXiv

Unite-Audio 把音频表征学习与潜在流匹配联合训练,用紧凑模型取得有竞争力的文本到音频生成效果

该工作提出 Unite-Audio,将连续音频表征学习与潜在流匹配联合训练用于文本到音频生成,通过把重建与自监督生成预测耦合,让生成目标直接塑造潜在空间,并采用 Flow-GRPO 后训练改善文本条件生成;实验显示紧凑的潜在流模型取得有竞争力的文本到音频性能,消融研究确认联合学习音频表征与生成模型带来收益。
arXiv

零数据自博弈预训练:生成器与学习器从随机初始化协同训练,在多个自然数据集上零样本损失随自博弈算力可预测地缩放

该工作提出「零数据自博弈预训练」的概念验证:从随机初始化开始,一个生成器提出由通用图灵机解释的程序以产生字节序列,一个学习器以标准交叉熵自回归预测这些字节序列,生成器则用强化学习被训练去产出处于学习器能力前沿的序列,从而形成自适应课程;由于生成器与学习器都未在自然数据上训练,作者用自然数据上的零样本表现作为迁移的干净检验,结果在多个自然数据集上零样本损失随自博弈算力呈现可预测的缩放,模型还表现出上下文学习,并在训练中发现可识别的数学序列。
arXiv

MILO 用块级低秩压缩把多示例上下文 KV 缓存最多减半,Qwen2.5 上吞吐提升 1.8 倍且分类与推理性能几乎不降

该工作提出 MILO 压缩框架,利用多示例上下文中的低秩冗余,以块为粒度压缩 KV 缓存,并按信息熵动态分配秩预算,在 Qwen2.5 模型上实现最多 50% 的 KV 缓存内存下降与 1.8 倍吞吐提升,在分类与推理基准上性能下降可忽略,并显著优于既有基线。
arXiv

全AI编写代码库的完整开发史被公开:21,000行Python工具中14.3%的AI代码生成事件含真实错误,约每4-5条交互回复就有1条含事实错误

该工作公开了一个由Claude AI完全编写、无任何人类代码或测试的21,000行Python工具的完整开发历史数据集,并配套两个代码溯源工具与三套分类体系(指令意图、提交来源、回复可靠性),据此分析发现:用户通过编码代理CLI下达的指令与IDE聊天指令在性质上不同,更侧重理解、规划与咨询;代码开发以主动式为主;14.3%的AI代码生成事件包含被AI自写测试套件后续捕获的真实错误;约每4-5条AI交互回复中就有1条含一个或多个事实错误。
arXiv

WebArxiv 用 510 个静态快照任务评测网页智能体,发现其依赖固定交互历史并引入动态记忆机制

该工作提出 WebArxiv——一个基于 arXiv 静态快照、包含 510 个时间不变任务且每个任务有唯一确定性真值的基准,用于评测多模态网页智能体在学术检索、细粒度内容抽取与跨论文比较等任务上的表现;对多种基于基础模型的网页智能体的评测显示该基准仍具挑战性,行为分析发现智能体过度依赖固定交互历史,导致推理不完整或重复,作者因此为智能体加入轻量级动态记忆机制以支持对相关上下文的自适应检索与推理。
arXiv

在思维链提示下直接读取答案标签logits,Qwen2.5-VL-7B在ScienceQA上从80.76%跌至45.48%,且93.54%的预测落在第一个选项槽位

该工作指出一种被称为“CoT-prefix scoring”的评测做法——在提示中加入思维链推理线索、却在模型生成任何推理内容之前就读取答案标签logits——并报告在ScienceQA上Qwen2.5-VL-7B的准确率从80.76%降至45.48%,在五种选项内容排列下93.54%的预测选择第一个槽位,而条件匹配的线性探针可从相同隐藏状态恢复78.94%、自由生成可恢复75.24%,词汇与层级诊断显示概率质量转向续写词元而答案信息在后期层仍线性可及,说明该效应是评测接口错配而非模型知识缺失。
arXiv

审计发现多语言情感生成基准的头条结论源于测量工具而非系统差异,并提出表情情感可解码性探针

该工作审计了一个多语言情感生成基准:八个指令微调大模型为17,100条孟加拉语、英语和印地语句子生成表情摘要,配合6,960条人工判断,发现把标注者视为随机因子后没有任何系统之间存在显著差异(F(7,14)=0.59,p=0.76),而常规分析却宣称28组两两比较中有19组显著;标注者身份解释的评分方差远多于系统身份,去掉任一标注者都会改变获胜系统;排序与输出长度相关,平均表情数量解释78.7%的系统间方差,在2,599对长度匹配比较中排行榜发生反转;跨提供者的各向异性差异在均值中心化后消失,每语言token成本随归一化单位改变符号,多视图按行切分使macro-F1虚高3.1个点并改变排名第一
arXiv

把治理评审门禁交给智能体:DGF-Bench 上最强模型严格门禁成功率 94.98%,但完整路线成功率仅 76.92%

该工作提出面向数字治理框架(DGF)的任务替代框架,把每个治理门禁视为可执行契约,要求信息充分、决策与权限校验有效,并在计入例外、核验、纠错与维护后仍能减少总人力;作者推导出残余工作量阈值,说明为何自动化大多数案例仍可能增加劳动,并用 DGF-Bench(300 个合成项目、899 次可评估的模型-项目运行)测量模型表现:Gemini 3.8 Flash、GPT-5.6 Luna、DeepSeek v4.1 Flash 的严格门禁成功率为 94.98%、83.29%、74.18%,完整路线成功率为 76.92%、42.33%、24.67%,确定性对照在给定规则与结构化事实下通过全部 1,700 个门禁,证据审计与 135
arXiv

疼痛定位的诊断价值被拆成三种失败:解剖复用、中枢放大与个体化偏移,而非单一梯度

该文提出患者报告的疼痛定位之所以有时诊断决定性、有时几乎无信息,是因为它包含三种认识论上不同的失败——解剖复用造成的不可识别反问题、中枢敏化或伤害可塑性疼痛带来的生成模型改变、以及推测为系统且因人而异的牵涉与不典型位移——三者对应同一个贝叶斯推断问题在似然、模型类别与群组条件先验三个节点上的失效,报告本身构成第四个节点;作者据此指出已发表的高效用准确度区间依赖被高估的特异度,因此梯度真实存在但比通常描绘的更平缓,并把“检测改善但治疗 uptake 滞后时结局未改善”归因于照护路径而非感知。
arXiv

Reflex-Guard 以 37.6 毫秒本地护栏实现 95.9% 有害提示召回,快于 Llama Guard 2 与 SafeDecoding

该工作提出 Reflex-Guard,一个本地运行的轻量级 LLM 提示安全护栏,结合越狱感知预处理、紧凑句向量嵌入与七个快速二分类器,在来自五个互补来源、共 30,568 条样本的平衡数据集上实现 95.9% 有害提示召回与 37.6 毫秒端到端延迟,快于 Llama Guard 2(255 毫秒)和 SafeDecoding(723 毫秒),默认阈值下可检出 100% 的 GCG 后缀攻击与 Base64 编码提示,而 DrAttack 结构化提示需将阈值降至 0.03 才能达到最佳检测。
arXiv

XACT 在可逆时频变换系数上学习稀疏归因掩码,在合成数据上比基线更少高亮伪特征,在两个真实数据集上给出稀疏且有结构的解释

作者提出 XACT 这一通用框架,在任意可逆时频变换(STFT、连续小波变换、离散小波变换)的系数上学习稀疏归因掩码,并把虚拟检查层从 STFT 扩展到两种小波变换以使 LRP 能在这些表示中生成解释;在合成数据集上 XACT 给出精确解释且比所测试基线更不易高亮伪特征,在两个真实数据集上给出稀疏且有结构的解释,但没有方法在所有定量评价标准上都最优。
arXiv

TP-CRIV 提出第三方挑战—应答身份验证框架,在十个 ImageNet 预训练 TorchVision 模型上实现同模型与跨模型的可分离验证

该工作提出面向 AI 模型的第三方挑战—应答身份验证框架 TP-CRIV,在验证者既无白盒也无 API 访问、只能通过可疑部署服务的普通黑盒推理接口交互、且不需要服务提供方协议配合的条件下,通过全新未披露的挑战与网络隔离获取经验证据,判断声称方是否本地拥有与所部署模型相符的预声明身份;作者以基于概率控制的见证生成方法为 CNN 图像分类器实例化该框架,并在十个 ImageNet 预训练 TorchVision 模型上展示了清晰的同模型/跨模型分离以及使用独立校准阈值的有限挑战次数验证。
arXiv

LiveMathematicianBench 用训练截止后发表的 arXiv 定理评测大模型,最强模型仅得 43.5%,替换抗性下 Gemini-3.1-pro-preview 跌至 17.6% 低于随机基线

该工作提出 LiveMathematicianBench,一个从模型训练截止之后发表的近期 arXiv 论文中构建的动态多选题基准,用于评测研究级数学推理;它引入十三类定理类型的逻辑分类体系、以证明梗概引导的干扰项生成流程,以及替换抗性机制,评测显示基准远未饱和——最佳模型 Gemini-3.1-pro-preview 仅得 43.5%,在替换抗性评测下 GPT-5.4 以 30.6% 居首,而 Gemini-3.1-pro-preview 降至 17.6%,低于 20% 的随机基线;双模式协议显示提供证明梗概可带来一致的准确率提升。