AI 核心
906 条内容
把掩码扩散解码拆成五个轴后,研究者发现状态自适应只在少数可预测状态上值得做,选择性干预让三个模型的整任务宏平均效用分别提升3.2、4.0和5.6个百分点
该工作把掩码扩散语言模型的解码策略拆成 score、cardinality、region、commitment、planning 五个轴,用“策略反转”定义自适应机会(最优候选动作相对验证集选出的固定动作的一步效用优势),在三个模型(LLaDA-8B-Instruct、LLaDA-1.5、Dream-7B)和十个任务上发现自适应机会高度异质,并据此提出选择性自适应:用验证提示校准的轻量检测器识别高机会状态,例如在 LLaDA-8B 的 Constrained JSON Fill 上只对排名前 10% 的状态做 region 自适应即可捕获 56.9% 的候选集 oracle 机会,端到端选择性解码把任务宏平均效用从 0.392
PatchHolmes 让智能体一次读完 100 个候选提交,把漏洞补丁检索的 Recall@1 从 32.63% 提到 59.95%
PatchHolmes 是一个两阶段补丁检索系统,第一阶段用 BM25 加时间衰减与 Qwen3-Embedding-8B 稠密检索经 RRF 融合出 top-100 候选,第二阶段让一个冻结的开源权重 LLM 智能体通过 list_candidates、read_commit、read_file_diff、submit_answer 四个工具以列表式方式查看全部 100 个候选并只提交一个最佳提交;在 GitHubAD 的 809 个 CVE 上 Recall@1 达 59.95%,比逐点分类器 Favia 高 25.34%、比 IRCoT 高 31.40%,在候选集完全相同的条件下智能体本身比直接取检索器首位高 27.32%,同一智能体不加改动迁移到
LEAP 让小时级音视频问答不再整段塞进上下文:在 Qwen3-Omni-30B 上比官方配方高 4.5–16.8%,并迁移到 MiniCPM-o 4.5
LEAP 把小时级录音切成固定时长块、对每块做一次轻量定位打分以挑出少量候选窗口,再把这些窗口重新编码进一次有界作答,从而让作答输入与峰值上下文不随录音时长增长;在多个 AVQA 基准上比 Qwen3-Omni-30B-A3B 基线提升 4.5–16.8%,并迁移到 MiniCPM-o 4.5 超过其已发表结果 3.1–13.0%。
EvoDuet 让大模型在进化搜索中按知识缺口检索网页,在 21 项优化任务上把 OpenEvolve 的归一化发现增益从 74.1% 提到 78.0%(GPT-5.6-Luna)、从 61.3% 提到 82.3%(Gemini-3.8-Flash),并在 8 项任务上超过此前最好成绩
该工作提出 EvoDuet,一种在模型参数固定的前提下让解与网络搜索查询双层协同进化的方法:每轮由基于知识缺口的检索门决定检索新文档、复用已存文档或不检索,内层循环按“假设证据评分”预测文档能带来的解分数并据此改写查询,外层循环并行生成候选并把评估结果写回搜索数据库;在 21 项优化任务、每轮一个候选的设置下,它把 OpenEvolve 的归一化发现增益从 74.1% 提升到 78.0%(GPT-5.6-Luna)、从 61.3% 提升到 82.3%(Gemini-3.8-Flash),Qwen3.5-9B 未获益,最佳运行在 8 项任务上超过此前报告的最好成绩、3 项持平,并在 Sums/Diffs 与 Denoising 上同
Mid-Harness 在模型与执行框架之间验证候选动作,把 TMAX-9B 在 TerminalBench-Lite 上的 Pass@1 从 50.00% 提升到 68.03%
该工作提出 Mid-Harness,在动作生成器与执行框架之间对候选动作进行采样与验证后再执行其中一个,在保持生成器和框架不变的前提下研究动作级测试时计算扩展:在 TerminalBench-Lite 上,用 GPT-5.6 Sol 作为验证器把 TMAX-9B 的 Pass@1 从 50.00% 提升到 68.03%(8 个候选动作),而弱验证下增加采样宽度收益很小,成对验证在自验证设置中表现最好,把强验证器的响应蒸馏进 TMAX-9B 可进一步提升 Pass@1,且动作级扩展与轨迹级扩展(Best-of-N 与 Sequential Refine)组合后能以更低的估计 token 成本取得更高成功率。
去掉重叠窗口的计时捷径后,非侵入式脑到文本解码在五个观测下把词错误率降到36.6%
该研究指出,d'Ascoli 等人(2025)联合解码句子中所有词的做法,其大部分性能提升可在不含脑信息的合成信号上复现(合成信号22.0%对真实MEG 22.3%),原因是相邻的三秒词对齐窗口相互重叠、隐式泄露了词时长;作者改为逐词独立解码(SimpleB2T),使多观测聚合与大语言模型先验变得有效,在临床沟通基准上以每词五次观测达到36.6%的词错误率。
RegLLM 诊断框架在两次同配置 GPU 试点中暴露方差:升级召回率 1.0 对 0.5,同一适配器效果方向翻转
作者提出 RegLLM——一个面向受监管智能体工作流的“有限自主”诊断框架,用六项可信度信号(引用有效性、来源接地、模式合规、升级正确性、宪法对齐、不安全动作率)配合确定性运行时监督器,在离线参考运行(n=12)中把升级召回率从 0 提升到 0.67、把不安全动作率从 0.33 降到 0.08,而在两次名义同配置的单卡 Qwen2.5-3B LoRA/DPO 试点(n=8,同种子同评测划分)中观察到任务成功率 0.25 对 0.12、升级召回率 1.0 对 0.5,且同一答案质量适配器对升级召回的影响在两次运行间方向相反,说明该规模下适配器效应无法与采样和硬件方差区分。
GPT-6 Astra 作为具身策略的六域评测:导航领先、混合控制提升操作成功率,但直接手内控制与密集参考运动仍不可靠
该工作系统评测 GPT-6 Astra 在夹爪操作、灵巧操作、移动操作、导航、运动与类人全身操作六个领域的具身策略能力,比较直接控制与配合学习策略或全身控制器的混合控制,发现导航表现领先(RxR 指令跟随 92%、HM3D 物体搜索 82%),混合控制在 RoboDojo 达 48%、DexJoCo 达 50%、RoboCasa365 达 38.7%,而直接手内控制与密集参考运动仍不可靠,并记录了显著的 token 消耗与推理延迟。
AIM 把研究想法当作显式搜索对象:在 10 项 AutoLab 任务上平均分达 67.0% 与 55.8%,并以最多 3.1 倍更短墙钟时间追平最强基线
该工作提出全自主的 Agentic Idea Manager(AIM)框架,把研究想法作为显式搜索对象,用受贝叶斯优化启发的 Agentic Surrogate 组织想法簇并做序数式前景估计、Agentic Acquisition 在簇级与想法级平衡探索与利用、Solution Auditor 校验想法与实现的一致性、Resource Planner 在固定预算下动态分配并行分支,在 10 项 AutoLab 任务上取得 System Optimization 平均 67.0%、长时程 Model Development & CUDA 平均 55.8%,分别超过最强基线 ScientistOne 1.6 与 4.9 个百分点,并以最多 3.1 倍更短的墙钟时
第 6 页 · 当前显示 10 项