AI 核心
961 条内容
谷歌研究提出 Diffusion Controller:轻量“转向阻尼器”网络在灰盒条件下于 HPS-v2 胜率上超过 LoRA,白盒版本对基线取得 90% 胜率
谷歌研究(Chih-wei Hsu 与 Moonkyung Ryu)提出 Diffusion Controller 框架,把扩散模型的去噪过程重新表述为平滑的连续控制问题,用一个轻量“转向阻尼器”网络在冻结基座模型的前提下动态修正生成轨迹;在 Stable Diffusion v1.4 骨干上,他们用 SFT、RWL 和 PPO 三种微调方式与 HPS-v2 人类偏好评分进行评估,报告称该框架在白盒与灰盒环境下均优于对应基线,灰盒版本在 SFT 与 RWL 路径上的 HPS-v2 胜率超过 LoRA 且改动的内部层更少,白盒版本对基线取得 90% 胜率,并可通过单一推理时引导强度参数在线调节约束强度。
NVIDIA VSS Blueprint 3.3 用单条提示在 30 分钟内搭出视觉 AI 智能体,并让 VLM 输入 token 减少 80%
NVIDIA 发布 VSS Blueprint 3.3,新增 Build Vision Agent 技能(vss-build-vision-ai)与自适应高效视频采样(Adaptive EVS):前者让编码智能体从自然语言请求出发,复用四个已验证配置档并只计算最小增量,在双 GPU RTX PRO 6000 Blackwell 主机上把橙汁灌装线溢出告警智能体在 30 分钟内交付为可预览部署;后者在 RTX PRO 6000 Blackwell 上运行 Cosmos 3 Super FP8 时,把告警上下文延迟从 1,021 ms 降到 844 ms(17%),并发实时 VLM 流从 13 提升到 19(46%),并把 60 分钟视频摘要的 VLM 输入 token 减少 80%
MaLiang-Harness 用可执行程序生成图像与视频:GPT-6-Astra 在两个基准上达成 100% 生成成功,图像 96.0%、视频 76.9% 满足全部质量阈值
该工作提出 MaLiang-Harness 框架,把 MLLM 驱动的图像与视频生成组织为“构建—检查—修订”的持续过程,用持久可执行生成状态、可追踪生成过程和修订感知编辑与验证三项机制共享同一修订参照,并在 MaLiang-IBench(50 个文生图提示)与 MaLiang-VBench(13 个文生视频提示)上评测 11 个与 4 个闭源 MLLM,测得 GPT-6-Astra 在两个基准上生成成功率均为 100%,96.0% 图像任务与 76.9% 视频任务满足全部质量阈值。
VoxMem 用 3196 道题测 15 个音频大模型:32K 上下文下无一超过 40%,换成文字稿后说话人识别从 69.8% 掉到 10.3%
研究者提出按“声学证据类型(语音语义、说话人身份、副语言线索、环境声音)×记忆操作(信息抽取、多会话推理、时序演化追踪、拒答)”两轴组织的口语对话记忆分类法,并据此构建 VoxMem 基准:3196 个评测实例、34743 段会话、177 小时音频,覆盖 8K 至 64K 四种上下文预算;评测 15 个大型音频语言模型后发现,32K 预算下无一模型总体准确率超过 40%(最强 38.5%),模型对“说了什么”的记忆明显好于“谁说的、怎么说的、周围有什么声音”,且把音频换成精确文字稿后说话人准确率从 69.8% 降至 10.3%,而语音语义仅从 75.9% 微降至 71.0%。
ActFirst-OPD 让多轮智能体先行动后推理,在 ALFWorld、WebShop、ScienceWorld 上把同策略蒸馏训练提速 2.3、1.8、4.9 倍
该工作提出 ActFirst-OPD,把环境交互与完整响应生成解耦:学生模型借助参考下一观测做参考条件逆动力学推断并执行动作,一旦转移偏离参考轨迹就切换为自主下一动作预测,同时从收集到的交互上下文异步生成完整“先思考后行动”响应供教师做 token 级监督;在 0.6B、1.7B、4B 的 Qwen3 学生上,相对 Vanilla OPD 在 ALFWorld、WebShop、ScienceWorld 取得平均 2.3 倍、1.8 倍、4.9 倍的墙钟训练加速,并在九个基准–模型设置中的八个里平均任务成功率持平或更高。
SaveRouter 只用约三分之一监督反馈就把 LLM 路由的盈亏平衡点最多提前约 9.5 倍
该工作提出 SaveRouter 稀疏监督路由框架,通过自适应选取信息量大的查询—模型反馈并跨相关查询共享能力信息,在四个路由基准上仅用约 33–41% 的可用训练反馈即保持有竞争力或更好的路由质量,并把盈亏平衡部署量相对最快的传统全监督路由降低约 1.9–9.5 倍。
PanoVLN 用全景视觉把 R2R-CE 成功率推到 77.3%,比此前最好结果高 11.9 个百分点
PanoVLN 以 4B 视觉语言模型和纯 RGB 全景输入做连续环境视觉语言导航,通过更长动作序列监督、置信度引导执行、面向决策的训练数据与全景几何特征融合,在 R2R-CE 与 RxR-CE Val-Unseen 上把成功率提升到 77.3% 和 78.0%,分别超过此前最好结果 11.9 和 8.7 个百分点,并在四足机器人上实现更少停顿的实机导航。
HDL 用「事后分歧」定位分支点:生成 token 减少 35–61%,智能体任务最高提升 12.46 分
该工作提出 Hindsight-Divergence Localization(HDL),用加入验证器反馈与反思后 token 对数似然的变化幅度来挑选轨迹中的分支点,只生成少量完整根轨迹、其余槽位用复用前缀的续写填充,在数学、代码与智能体三类任务、三个模型上相对 GRPO 减少 35–61% 生成 token、缩短 18–45% rollout 墙钟时间,同时提升任务表现,智能体任务最高提升 12.46 个百分点。
EasyPPO 指出 PPO 评论家两类失效模式,在三项任务上稳定训练并相对 PPO 提升 14.89%、2.28%、9.47%
该工作识别出 PPO 在 LLM 强化学习中的两类评论家失效模式——对截断轨迹同时过滤演员与评论家会把策略目标变为“以完成为条件”的奖励,以及同一批次内不同提示的回报噪声异质会让高方差提示主导评论家更新——并提出 EasyPPO,用仅作用于演员的超长过滤、按回报标准差倒数加权的噪声归一化评论家回归、以及配合梯度裁剪的适度更小评论家小批量来应对,在 FrontierCS 连续奖励编程、AIME24 二元奖励数学推理和 Search-R1 多轮搜索上全程保持稳定,最佳验证分数相对 PPO 分别提升 14.89%、2.28% 和 9.47%。
第 18 页 · 当前显示 10 项