跳到主要内容

检索

“全部学科” · 1364 项结果

第 6 页 · 当前显示 20 项
arXiv

同一观测对应多个有效动作时,CVAE 的 KL 正则与流模型的 Lipschitz 平滑度决定策略能否保留多模态,而主流机器人仿真基准其实几乎单模态

该工作形式化定义了行为克隆中的多模态,证明潜变量策略保留示范模态需要潜表示携带动作条件信息、过强的后验—先验正则会压制该信息,动作空间生成策略则受基分布到动作映射的 Lipschitz 常数限制,并在合成多模态导航、真实机器人双模态组织抓取任务上验证这些机制,同时用基于 GMM 模态聚类的诊断发现 Push-T、UR3、LIBERO、Meta-World 等标准仿真基准的条件多模态很有限、确定性回归仍有竞争力。
arXiv

AIM 把研究想法当作显式搜索对象:在 10 项 AutoLab 任务上平均分达 67.0% 与 55.8%,并以最多 3.1 倍更短墙钟时间追平最强基线

该工作提出全自主的 Agentic Idea Manager(AIM)框架,把研究想法作为显式搜索对象,用受贝叶斯优化启发的 Agentic Surrogate 组织想法簇并做序数式前景估计、Agentic Acquisition 在簇级与想法级平衡探索与利用、Solution Auditor 校验想法与实现的一致性、Resource Planner 在固定预算下动态分配并行分支,在 10 项 AutoLab 任务上取得 System Optimization 平均 67.0%、长时程 Model Development & CUDA 平均 55.8%,分别超过最强基线 ScientistOne 1.6 与 4.9 个百分点,并以最多 3.1 倍更短的墙钟时
arXiv

PivotOPD 把蒸馏集中在关键失误及其后几轮,让 Qwen3-1.7B 在 ALFWorld 上比最强基线高 5.5 个百分点

该工作分析 ALFWorld 上 Qwen3 系列(8B–235B)的失败轨迹,发现过半失败含有一个早期且通常可恢复的“关键失误”,据此提出 PivotOPD:用教师模型定位关键轮并给出金动作与后续恢复动作,以反向 KL 做预防蒸馏、以正向 KL 做恢复蒸馏,与组相对 RL 合并进一次 PPO 更新,在 ALFWorld、WebShop、Search-based QA 上对 Qwen3-1.7B 与 Qwen3-8B 均取得最高平均表现,并把增益迁移到 Nemotron-3.5 在 SWE-Bench Verified 上的解决率(+3.2%)。
arXiv

SlideDP 让多 GPU 共享主机内存的全参数微调提速 1.46–2.64 倍,并在四张 H100 上以更大批次超过 FSDP2 峰值 11.2%

SlideDP 提出一种面向共享主机多 GPU 系统的同步数据并行运行时,通过维护单一权威主机状态、将通信路径与状态布局解耦、并在 rank 与 chunk 之间流水化参数下发、梯度聚合与 CPU 更新,在匹配批次扫描中对 SlideFormer、MegaTrain 和 ZeRO-Offload 取得 1.46–2.64 倍的几何平均吞吐比,在四张 H100 上以较小批次接近 GPU 常驻的 FSDP2、以较大批次超过其测得峰值吞吐 11.2%,并支持 Qwen3-14B 的 256K token 序列以及在四张 RTX 4090 上微调 Qwen2.5-72B。
arXiv

Mid-Harness 在模型与执行框架之间验证候选动作,把 TMAX-9B 在 TerminalBench-Lite 上的 Pass@1 从 50.00% 提升到 68.03%

该工作提出 Mid-Harness,在动作生成器与执行框架之间对候选动作进行采样与验证后再执行其中一个,在保持生成器和框架不变的前提下研究动作级测试时计算扩展:在 TerminalBench-Lite 上,用 GPT-5.6 Sol 作为验证器把 TMAX-9B 的 Pass@1 从 50.00% 提升到 68.03%(8 个候选动作),而弱验证下增加采样宽度收益很小,成对验证在自验证设置中表现最好,把强验证器的响应蒸馏进 TMAX-9B 可进一步提升 Pass@1,且动作级扩展与轨迹级扩展(Best-of-N 与 Sequential Refine)组合后能以更低的估计 token 成本取得更高成功率。
arXiv

UniEvo-VL 让多模态模型用自己的批评做老师,GenEval 从 0.747 升到 0.808

UniEvo-VL 提出一种在线策略自蒸馏(OPSD)训练配方:让同一个多模态模型分别扮演只看原始提示的学生和额外看到批评改写提示的老师,在学生的去噪轨迹上最小化两者逐状态分布差异,在 Qwen-Image-2512 上把 GenEval 从 0.747 提升到 0.808、GenEval2 Soft-TIFA 从 32.97 提升到 35.53,并显示更强外部批评者(GPT5.6-Luna)可带来更高上限,而文本渲染等任务的收益并不一致。
arXiv

GGSD 用 1v1 自博弈把五个按键变成可玩技能:人类在 Ant、Franka、G1 上零训练通关 Maze 与 CubePush

该工作提出 Game-Guided Skill Discovery(GGSD),在 1v1 竞争游戏中让分层智能体与历史策略池自博弈,高层策略从 5 个(G1 为 6 个)离散技能中选择、低层技能条件策略输出电机动作,并用互信息奖励区分技能语义;训练后人类可直接用同一组离散技能替换高层策略,在 Ant、Franka 机械臂与 Unitree G1 上组合出未训练过的 Maze 与 CubePush 任务,人类评测平均成功率至少 84%。
arXiv

LoopVL 用共享参数循环 128 层,在 MMStar 上把 1B 骨干从 55.33 提到 63.47,并观察到跨循环的 Visual Aha Moment

作者提出 LoopVL,把循环 Transformer 扩展到视觉语言模型:语言骨干基于 HRM-Text 开源框架与数据自行预训练,采用 Module-Loop 与 Model-Loop 嵌套的 H/L 共享参数结构,默认 H2L3 配置下一次前向执行 128 次 Transformer 层调用;在相同 0.14T token 训练预算下,LoopVL 在 MMStar、RealWorldQA、ChartQA 等基准上超过同层数的 Transformer-VL 1B,并接近或超过更大的 4B 稠密基线,同时作者报告了跨模型循环的视觉注意力重分配现象,称为 Visual Aha Moment。
arXiv

GPT-6 Astra 作为具身策略的六域评测:导航领先、混合控制提升操作成功率,但直接手内控制与密集参考运动仍不可靠

该工作系统评测 GPT-6 Astra 在夹爪操作、灵巧操作、移动操作、导航、运动与类人全身操作六个领域的具身策略能力,比较直接控制与配合学习策略或全身控制器的混合控制,发现导航表现领先(RxR 指令跟随 92%、HM3D 物体搜索 82%),混合控制在 RoboDojo 达 48%、DexJoCo 达 50%、RoboCasa365 达 38.7%,而直接手内控制与密集参考运动仍不可靠,并记录了显著的 token 消耗与推理延迟。
arXiv

800个模型预训练显示:野生AI网页文本在数据充足时抬高损失,31.1%的AI占比需多花1.6倍算力

研究者用EditLens与Pangram标注2021至2026年的Common Crawl网页数据,发现2026年6月通过FineWeb质量过滤的token中有27.5%为AI生成、8月升至31.1%,并预训练800个19.9M至973M参数的模型、改变AI与人类token比例,拟合出含独立收益项与损害项的新缩放律:AI token对数据匮乏模型先降损失后饱和反转,对Chinchilla最优预算模型几乎立即抬高损失,该律在留出规模上预测误差低于11个已有缩放律,并据此估算按2026年8月AI占比训练需1.6倍算力。
arXiv

ATLAS 在 LeWM 中同时保留关系几何与校准潜变量分布,在 PushT、TwoRoom 与 OGBench-Cube 上提升目标达成成功率,TwoRoom 高新颖度回合增益最大

作者提出 ATLAS 训练目标,将编码器均值池化 patch 特征的归一化成对结构迁移到规划潜变量,并用基于一维 Wasserstein-2 传输的 WEMReg 校准其边缘分布,在 LeWM 上实例化后在 PushT、TwoRoom 与 OGBench-Cube 的低与高新颖度子集上均提升平均目标达成成功率,其中 TwoRoom 高新颖度回合增益最大,同时诊断显示规划潜变量中与新颖度相关的结构更强、边缘校准更好、多步预测误差更低。
arXiv

把合成预预训练从1B推到7B、100B token后,作者发现省token的收益仍在,但来源不是语法先验而是长程检索

该研究在500M至7B四种参数规模、四种预训练数据混合、五种预预训练任务和最高100B token的预训练预算下系统评估合成预预训练(PPT),发现其下游性能与token效率收益在规模上持续存在(3B规模至少节省21B预训练token),但没有一致证据表明收益来自语法先验,收益只出现在能改善长程检索的PPT任务上,且对代码与数学占比不敏感、仅在缺少网页文本时消失。
arXiv

去掉重叠窗口的计时捷径后,非侵入式脑到文本解码在五个观测下把词错误率降到36.6%

该研究指出,d'Ascoli 等人(2025)联合解码句子中所有词的做法,其大部分性能提升可在不含脑信息的合成信号上复现(合成信号22.0%对真实MEG 22.3%),原因是相邻的三秒词对齐窗口相互重叠、隐式泄露了词时长;作者改为逐词独立解码(SimpleB2T),使多观测聚合与大语言模型先验变得有效,在临床沟通基准上以每词五次观测达到36.6%的词错误率。
arXiv

SkillSeek 用 BM25 加小型重排器在 89 项 SkillsBench 任务上追平 LLM 介导检索,单次花费从 51.30 美元降到 27.54 美元

该工作提出开源两阶段技能检索器 SkillSeek(BGE-base 双编码器接小型交叉编码器,经 MCP 暴露),在 89 项 SkillsBench 基准、两种技能池与两种骨干模型的网格上,观察到纯 bm25 在四个设置中的三个达到或超过 Liu 等人 LLM 介导循环的通过率,小型交叉编码器在第四个设置(34K 池 + Qwen3.5)补齐差距至相同的 0.442,同时把每次试验总花费从 51.30 美元降到 27.54 美元(距无技能基线 27.41 美元不到五十美分),并把这一模式归因于第一阶段召回上限。
Nature News

丹麦基金会资助数据显示子宫内膜异位症研究仅获17.4万欧元,而糖尿病获2.55亿欧元;小鼠研究提示改造后的尼氯酰胺可逆转病灶诱导的巨噬细胞变化

一篇《自然》新闻报道介绍了一项发表于《Advanced Healthcare Materials》的小鼠研究,该研究改造了抗寄生虫药尼氯酰胺以靶向子宫内膜异位症相关细胞;同时,一篇《npj Women's Health》分析显示,在丹麦前100家资助型基金会中,子宫内膜异位症研究仅获得173,958欧元,而糖尿病获得254,908,430欧元、炎症性肠病获得325,940欧元,媒体提及量也相差悬殊。
arXiv

Endless Exam 用 14 族数学构造题给九个模型打分:GPT-6 Astra 带工具后总分 143.16,但 30 个已发表前沿无一被超越

作者提出 Endless Exam 基准,覆盖十四类参数化数学构造问题、共 69 个评测实例,对提交对象自动验证有效性并给出不设上限的相对质量分(100 分等于平均达到参考构造),在九个模型、十七种配置上评测发现:无工具时总分从 7.55 到 91.90,带代码与网络工具后 GPT-6 Astra、GPT-5.6 Luna、Claude Opus 5.5 分别达到 143.16、119.35、180.06,但 30 个已发表前沿参考无一被超越。
arXiv

Galahad 用字节级精确 KV 记忆把 LLM 读文档变成一次性成本:97,000 token 语料上 100 题全对、每题 0.59–0.64 秒

Corbenic AI 的 Sietse Schelpe 提出 Galahad 记忆层(Taliesin 保存并复用字节精确的 KV 状态、Blaise 只把问题所需的那一节文本交给模型),在 100 条事实藏于 97,000 token 语料的召回测试(Gemma 4 31B)中,单用 Taliesin 在 llama.cpp 上答对 98/100、每题 3.0 秒与 572 焦,无 Galahad 的基线仅答对 10/100、9.3 秒与 2,754 焦,加上 Blaise 后三个运行时均答对 100/100、每题 0.59–0.64 秒与 200–213 焦,而调优后的 RAGFlow 管线答对 77。
arXiv

冻结智能体只训练潜在通信链路,良性训练即把有害顺从从文本通信水平推高,RL攻击把均值从27.9拉到76.9

该工作研究多智能体系统中以可训练轻量链路替代文本通信的潜在通信安全性,发现仅训练链路、冻结全部智能体参数时,良性链路训练即可相对文本通信提高有害顺从,攻击者可通过在有害问答对上优化链路、向良性训练数据投毒,或用奖励引导的强化学习攻击(无需有害目标回复)进一步放大该效应,在三种通信拓扑与四个安全基准上把平均有害顺从分数从良性训练链路的27.9提升到76.9,并显示把奖励转向更安全行为可仅更新链路就大幅降低有害顺从。
arXiv

跟踪微调轨迹发现:安全对齐的LLM在窄域微调中并非被“转向”有害,而是安全子空间被侵蚀,投影掉有害梯度子空间可在Qwen2.5-14B-IT上把自由生成涌现失准压低最多80.0%

该工作对涌现失准(EM)做了动态二阶几何研究:追踪训练轨迹发现方向性Hessian曲率集中在语义枢轴token上,Grassmann投影显示有害-安全差距扩大主要源于安全梯度重叠下降而非转向新的有害回路,据此提出参数级几何缓解框架,把经验有害梯度子空间从LoRA更新中正交投影掉,在Qwen2.5-14B-IT上把自由生成EM压低最多80.0%,并在四个开放权重指令模型家族(3B–20B)中通过教师强制评估显示同一有害子空间控制着冻结EM响应的条件支持度。
arXiv

EvoDuet 让大模型在进化搜索中按知识缺口检索网页,在 21 项优化任务上把 OpenEvolve 的归一化发现增益从 74.1% 提到 78.0%(GPT-5.6-Luna)、从 61.3% 提到 82.3%(Gemini-3.8-Flash),并在 8 项任务上超过此前最好成绩

该工作提出 EvoDuet,一种在模型参数固定的前提下让解与网络搜索查询双层协同进化的方法:每轮由基于知识缺口的检索门决定检索新文档、复用已存文档或不检索,内层循环按“假设证据评分”预测文档能带来的解分数并据此改写查询,外层循环并行生成候选并把评估结果写回搜索数据库;在 21 项优化任务、每轮一个候选的设置下,它把 OpenEvolve 的归一化发现增益从 74.1% 提升到 78.0%(GPT-5.6-Luna)、从 61.3% 提升到 82.3%(Gemini-3.8-Flash),Qwen3.5-9B 未获益,最佳运行在 8 项任务上超过此前报告的最好成绩、3 项持平,并在 Sums/Diffs 与 Denoising 上同