跳到主要内容

AI 核心

966 条内容

  1. arXiv

    ActFirst-OPD 让多轮智能体先行动后推理,在 ALFWorld、WebShop、ScienceWorld 上把同策略蒸馏训练提速 2.3、1.8、4.9 倍

    该工作提出 ActFirst-OPD,把环境交互与完整响应生成解耦:学生模型借助参考下一观测做参考条件逆动力学推断并执行动作,一旦转移偏离参考轨迹就切换为自主下一动作预测,同时从收集到的交互上下文异步生成完整“先思考后行动”响应供教师做 token 级监督;在 0.6B、1.7B、4B 的 Qwen3 学生上,相对 Vanilla OPD 在 ALFWorld、WebShop、ScienceWorld 取得平均 2.3 倍、1.8 倍、4.9 倍的墙钟训练加速,并在九个基准–模型设置中的八个里平均任务成功率持平或更高。
  2. arXiv

    SaveRouter 只用约三分之一监督反馈就把 LLM 路由的盈亏平衡点最多提前约 9.5 倍

    该工作提出 SaveRouter 稀疏监督路由框架,通过自适应选取信息量大的查询—模型反馈并跨相关查询共享能力信息,在四个路由基准上仅用约 33–41% 的可用训练反馈即保持有竞争力或更好的路由质量,并把盈亏平衡部署量相对最快的传统全监督路由降低约 1.9–9.5 倍。
  3. arXiv

    PanoVLN 用全景视觉把 R2R-CE 成功率推到 77.3%,比此前最好结果高 11.9 个百分点

    PanoVLN 以 4B 视觉语言模型和纯 RGB 全景输入做连续环境视觉语言导航,通过更长动作序列监督、置信度引导执行、面向决策的训练数据与全景几何特征融合,在 R2R-CE 与 RxR-CE Val-Unseen 上把成功率提升到 77.3% 和 78.0%,分别超过此前最好结果 11.9 和 8.7 个百分点,并在四足机器人上实现更少停顿的实机导航。
  4. arXiv

    HDL 用「事后分歧」定位分支点:生成 token 减少 35–61%,智能体任务最高提升 12.46 分

    该工作提出 Hindsight-Divergence Localization(HDL),用加入验证器反馈与反思后 token 对数似然的变化幅度来挑选轨迹中的分支点,只生成少量完整根轨迹、其余槽位用复用前缀的续写填充,在数学、代码与智能体三类任务、三个模型上相对 GRPO 减少 35–61% 生成 token、缩短 18–45% rollout 墙钟时间,同时提升任务表现,智能体任务最高提升 12.46 个百分点。
  5. arXiv

    EasyPPO 指出 PPO 评论家两类失效模式,在三项任务上稳定训练并相对 PPO 提升 14.89%、2.28%、9.47%

    该工作识别出 PPO 在 LLM 强化学习中的两类评论家失效模式——对截断轨迹同时过滤演员与评论家会把策略目标变为“以完成为条件”的奖励,以及同一批次内不同提示的回报噪声异质会让高方差提示主导评论家更新——并提出 EasyPPO,用仅作用于演员的超长过滤、按回报标准差倒数加权的噪声归一化评论家回归、以及配合梯度裁剪的适度更小评论家小批量来应对,在 FrontierCS 连续奖励编程、AIME24 二元奖励数学推理和 Search-R1 多轮搜索上全程保持稳定,最佳验证分数相对 PPO 分别提升 14.89%、2.28% 和 9.47%。
  6. arXiv

    WorldLine 用一万小时无动作视频预训练、两千小时跨十种本体动作轨迹接地,在失败轨迹上把机器人掩码 IoU 提升 0.1626,并以 74% 平均准确率预测轨迹成败

    WorldLine 提出一种动作驱动的视觉模拟器,把可迁移的机器人—物体动力学学习与异构动作接地解耦:先在超过 10,000 小时无动作机器人视频上预训练,再用超过 2,000 小时、跨十余种本体的动作轨迹通过图像空间动作图接地,并配合多视角、失败样本与关系正则化训练,最后用机器人聚焦的少步蒸馏实现因果 rollout;在留出与域外设置下保持视觉质量与机器人运动一致性,失败轨迹上机器人掩码 IoU 比最强基线高 0.1626,在 RoboTwin 与 AgiBot 上以 74% 平均准确率预测轨迹成败,并在未用 RoboTwin 训练或适配的情况下把任务成功率最多提升 21.4 个百分点。
  7. arXiv

    DeepMind 给 AI 设计的蛋白质嵌入 SynthIDBio 水印,绑定病毒、血管与免疫靶点仍保持活性,但换一个设计工具即可抹除

    谷歌 DeepMind 团队开发了 SynthIDBio,把统计水印同时写入 AI 设计蛋白质的氨基酸序列与三维结构,在不明显损害功能的前提下标记其“由 AI 生成”的来源;团队称水印蛋白对病毒侵染、血管生成和免疫调控相关靶点的结合效率与未加水印版本相当,但该标记在多数情况下可被另一个设计工具重新生成序列后擦除,因此被视为生物安全分层防护中的一层而非单一解决方案。
  8. arXiv

    字节跳动团队发现分块KV缓存压缩会让长上下文检索按压缩步长周期性变弱,DeepSeek-V4系列相位间准确率差距最高达40个百分点

    该工作提出并系统刻画了分块KV缓存压缩模型中的“相位敏感性”:同一信息在相对压缩窗口边界的不同相位上检索难度不同,DeepSeek-V4系列在128K上下文下相位间检索准确率差距最高达40.2个百分点,作者通过从零预训练23个压缩模型(Qwen3-0.6B骨干、100B token)复现该现象、用KV头与层级的均值替换消融揭示相位专门化、并用理想化归纳模型证明梯度流会驱动压缩门形成静态偏好,从而说明平均基准分数会掩盖周期性的位置性失败。
  9. arXiv

    复旦团队用千万级中文决策数据训练Chinese-Jev,通用任务准确率69.20%并比Jev快约20倍

    该工作提出Chinese-Jev:用统一数据处理流程把异构中文标注转成候选选项上的概率目标,先以1000万条通用中文决策预训练轻量编码器模型,再分别针对医疗、法律、金融微调,并发布含307,900条留出决策的CJ-Bench;预训练后在通用任务上准确率69.20%,相对闭源Jev提升1.24%,期望校准误差从11.45%降至3.78%,延迟14毫秒,医疗微调后准确率比Jev高4.0%,三个专业领域平均达到Jev的92%,平均延迟15毫秒,INT8量化模型可在手机浏览器上约1秒完成一次决策。
  10. arXiv

    TabFM-Auto 用 LLM 智能体围绕冻结的 TabFM 演化数据管线,在 TabArena 全部 51 个数据集上把 Elo 从 1785 提升到 2013

    TabFM-Auto 把冻结的表格基础模型 TabFM 与一个语言模型编码智能体配对,让智能体依据数据集元数据与验证反馈迭代改写数据清洗、特征工程、上下文选择和后处理四个阶段的管线,在 TabArena 全部 51 个数据集上五种配置占据总榜前五名,最佳配置(Codex 配 Opus 5)把 TabFM 从 1785.3 Elo 提升到 2013.0 Elo,所发现的管线无需再搜索即可迁移到 TabPFN-3、TabICLv2 和 EXAONE-Tabular(提升 69 至 143 Elo),并在 MLE-Bench 的 8 个表格竞赛中在 MLE 智能体里排名第一。

第 19 页 · 当前显示 10 项