跳到主要内容

AI 核心

906 条内容

  1. arXiv

    循环混合专家模型首次拥有联合缩放定律:稀疏度把循环的有效参数增益抬高并延后饱和

    该工作提出 Loop Scaling Laws,首次把循环(recurrence)与 MoE 稀疏度同模型规模、训练数据一起纳入同一个缩放定律,用一个有界且以稀疏度为条件的循环映射刻画循环带来的有效参数增益及其饱和点,在留出集上比线性与幂律映射预测损失更准,并据此在算力与显存约束下选择循环次数与专家数,在万亿 token 规模上让 0.3B 激活/1.3B 总参数的循环 MoE 在推理基准上追平约 2 倍大的非循环 MoE。
  2. arXiv

    DyRAD 用固定点扩散函数渲染动态驾驶场景的完整距离-方位-多普勒雷达张量,在 RADIal 上把参考检出目标的雷达检测恢复率从 26.9% 提升到 90.7%

    DyRAD 把动态驾驶场景表示为静态背景点反射体与跟随刚体轨迹的动态点反射体,用由雷达信号处理链推导并固定的解析点扩散函数渲染完整的距离-方位-多普勒(RAD)张量,多普勒既作为渲染输出又作为轨迹监督,在 RADIal、Boreas 与合成基准上同时评估轨迹内位姿与位移视角,在 RADIal 上把参考检出目标的雷达检测恢复率从最强基线的 26.9% 提升到 90.7%。
  3. arXiv

    Imagine3D-LLM 让多模态大模型先“想象”出紧凑 3D 场景再作答,在 SPAR-Bench 上以 7B 规模取得 68.5 平均分

    该工作提出 Imagine3D-LLM:在图像 token 之后追加一小组可学习的 Gaussian summary token,将其解码为紧凑的 3D Gaussian Splatting 表示,并用光度重建损失与标准下一 token 预测联合训练,使多视图多模态大模型在作答前先组装一个粗略的 3D 场景表示;在七个空间推理与 3D 场景理解基准上一致优于此前方法,SPAR-Bench 平均分达 68.5,超过最强空间感知基线 3DThinker-7B 5.2 分。
  4. arXiv

    RWTD 用奖励加权传输蒸馏把一步生成器的 GenEval 从 0.73 提到 0.80

    该工作提出奖励加权传输蒸馏(RWTD),一种只需生成样本与标量奖励评估的一步生成器后训练方法,它把当前模型与参考模型各自的奖励倾斜分布混合成自适应目标,并用特征空间最优传输与不动点回归实现,在一步 SANA Sprint 1.6B 上把 GenEval 从 0.73 提升到 0.80,并在偏好对齐实验中表现出跨奖励泛化。
  5. arXiv

    Tacit-TTS 用掩码非自回归解码把零样本语音克隆提速逾10倍,并在八种跨语言参考与婴儿咿呀、合成乱语参考上保持可用

    Tacit-TTS 从 IndexTTS2 蒸馏而来,用掩码非自回归生成替换自回归文本到语义解码、引入免训练声学长度的估计并对流匹配渲染器做 ReFlow 蒸馏,在两个英语和两个普通话数据集上取得有竞争力的零样本克隆质量,对超过 5 秒的语句生成速度比 IndexTTS2 快 10 倍以上,且无需参考语音转写即可支持跨语言与非词汇参考。
  6. arXiv

    OSWorld-Science 用 146 个科学软件任务测 12 个视觉语言模型:最强智能体平均仅 73.7%,最难任务集只有 40%

    该工作提出 OSWorld-Science 基准与评测环境,把专家定义的科学任务、基于产物的执行式评分器和统一智能体外壳结合起来,在 7 个科学领域、17 款软件、3 种语言上评测 12 个视觉语言模型,结果显示最强模型 Claude Fable 5.1 平均得分 73.7%、最难任务集约 40%,且失败多发生在交互层与结果校验环节而非科学推理本身。
  7. arXiv

    强化学习后训练视觉-语言-动作模型时,参数更新集中在仅占动作专家14.83%–27.58%的Timestep Modules,且其低秩方向可预测并提升任务成功率

    该工作系统分析了强化学习(RL)如何重塑基于流匹配的视觉-语言-动作(VLA)模型,发现RL在π0.5与GR00T N1.5/N1.6等模型、LIBERO/ManiSkill/MetaWorld/CALVIN等基准上诱导出高度集中于动作专家Timestep Modules的低秩参数更新,这些模块以14.83%–27.58%的参数占比承载了不成比例的RL性能增益,其shift向量更新方向能以最高99.6%的ROC-AUC预测任务成功,且沿该方向引导可在不额外RL训练的情况下进一步提升策略表现。
  8. arXiv

    用熵位移筛选蒸馏位置,让LLM评审在主观任务上比Dr. GRPO高出2–9个百分点

    该工作研究如何用自然语言反馈训练LLM评审,提出以教师与学生之间的逐位置熵位移来区分“语境锐化”和“语境扩散”两种机制,并据此遮蔽高熵位移位置,使自蒸馏评审在主观子类上比结果监督RL(Dr. GRPO)高出2–9个百分点,同时在客观子类上保持竞争力。
  9. arXiv

    GGSD 用 1v1 自博弈把五个按键变成可玩技能:人类在 Ant、Franka、G1 上零训练通关 Maze 与 CubePush

    该工作提出 Game-Guided Skill Discovery(GGSD),在 1v1 竞争游戏中让分层智能体与历史策略池自博弈,高层策略从 5 个(G1 为 6 个)离散技能中选择、低层技能条件策略输出电机动作,并用互信息奖励区分技能语义;训练后人类可直接用同一组离散技能替换高层策略,在 Ant、Franka 机械臂与 Unitree G1 上组合出未训练过的 Maze 与 CubePush 任务,人类评测平均成功率至少 84%。
  10. arXiv

    AED 把 50,228 条失败轨迹变成错误—诊断对:首次修正让验证器通过率从 18.4% 升到 51.1%,全诊断微调把 Qwen3-8B 的步级一致率从 47.2% 提到 63.6%

    该工作构建了 Agent Error Dataset(AED),包含来自 33 个环境、19 个 harness 家族和 23 个策略模型的 50,228 条错误—诊断对,并用五阶段 Agentic Error-to-Training(AET)流水线把自然失败连到诊断、修正建议与可选回放证据;在 3,062 对匹配回放中,首次提出的修正把验证器通过率从 18.4% 提升到 51.1%(+32.7 个百分点),在单独冻结的诊断发布上做全诊断微调,使 Qwen3-8B 与内部教师标签的精确步一致率从 47.2% 升至 63.6%(三个种子、943 例留出集平均),而单种子的 actor 训练对比中,仅动作修复训练在 WebShop-lite 上比仅成功训练

第 9 页 · 当前显示 10 项