跳到主要内容

AI 核心

927 条内容

  1. arXiv

    Jev 在 Amazon 三域重排中保持高 NDCG@10,延迟随候选集增大增长远慢于点式 Qwen

    该研究在 Amazon Reviews 2023 的 Movies and TV、Video Games、Books 三个域上,用 SASRec 检索出的高排名负例构造受控困难候选集(候选规模从 10 到 100),把被 TypeSafe AI 称为“System One Model”的决策导向模型 Jev 与 SASRec、DCNv2 以及 Qwen2.5 7B Instruct 的点式与列表式重排器对比,发现 Jev 在保持较强推荐效果(NDCG@10、Hit Rate@10、MRR)的同时,其观测服务延迟随候选集增大的增长明显比点式 Qwen 更平缓,但仍远高于推荐专用模型。
  2. arXiv

    SMART 用自进化多智能体把整季字幕翻译做成长程状态任务,在 15 个方向上取得最低 SubMQM 惩罚

    该工作提出 SMART,一个面向长篇字幕翻译的自进化多智能体系统:在测试时训练阶段构建持久化的剧集级记忆,通过动态图路由与 Mixture-of-Agents 层翻译一部分句子,并借助术语核验、字幕约束校验与上下文检索工具,由 judge-refiner 循环把文本批评回传以更新智能体提示与路由策略而不重训底层 LLM;测试时推理阶段用演化后的配置翻译剩余内容,同时发布覆盖 14 个类型、每剧 2–198 集、制作年份 1959–2023、15 个目标语区的 Subtitle Arena 基准与含 7 个维度、19 类错误的 SubMQM 评估框架,结果显示 SMART 在全部 15 个 Subtitle Arena 方向上取得最佳 Overall
  3. arXiv

    ATLAS 在 LeWM 中同时保留关系几何与校准潜变量分布,在 PushT、TwoRoom 与 OGBench-Cube 上提升目标达成成功率,TwoRoom 高新颖度回合增益最大

    作者提出 ATLAS 训练目标,将编码器均值池化 patch 特征的归一化成对结构迁移到规划潜变量,并用基于一维 Wasserstein-2 传输的 WEMReg 校准其边缘分布,在 LeWM 上实例化后在 PushT、TwoRoom 与 OGBench-Cube 的低与高新颖度子集上均提升平均目标达成成功率,其中 TwoRoom 高新颖度回合增益最大,同时诊断显示规划潜变量中与新颖度相关的结构更强、边缘校准更好、多步预测误差更低。
  4. arXiv

    S²D-OPD 只保留每条回答中教师-参考 JSD 最高的 10% 状态,在八个师生设定中的七个把留出准确率从 46.36% 提到 47.31%

    该工作指出 Direct-OPD 的 token 级对数比奖励只衡量相对变化,可以在教师与参考检查点分配给学生的候选 token 的概率质量趋于消失时保持不变,而教师-参考 JSD 与两个方向的 KL 会随之消失;据此提出 S²D-OPD,按教师-参考 JSD 对学生采样状态排序并屏蔽低散度状态上的监督,每条回答只保留最高的 10%,在两个教师对和四个 1.7B 至 8B 学生模型上,于 AIME 与 HMMT 留出基准的八个设定中有七个优于稠密 Direct-OPD、第八个持平,且不需要额外前向传播。
  5. arXiv

    SlideDP 让多 GPU 共享主机内存的全参数微调提速 1.46–2.64 倍,并在四张 H100 上以更大批次超过 FSDP2 峰值 11.2%

    SlideDP 提出一种面向共享主机多 GPU 系统的同步数据并行运行时,通过维护单一权威主机状态、将通信路径与状态布局解耦、并在 rank 与 chunk 之间流水化参数下发、梯度聚合与 CPU 更新,在匹配批次扫描中对 SlideFormer、MegaTrain 和 ZeRO-Offload 取得 1.46–2.64 倍的几何平均吞吐比,在四张 H100 上以较小批次接近 GPU 常驻的 FSDP2、以较大批次超过其测得峰值吞吐 11.2%,并支持 Qwen3-14B 的 256K token 序列以及在四张 RTX 4090 上微调 Qwen2.5-72B。
  6. arXiv

    EvolvingNav用时间索引的4D信念预测目标去向,在EvoWorld-Bench上把首次检查成功率从45.33%提升到61.32%

    该工作提出EvolvingNav,用带时间戳的3D物体历史构建“持续—迁移”信念,并通过事件驱动的预测—观察—重规划滤波器在目标可能于查询前或导航途中被移动的情况下推断其当前位置,同时发布包含54个场景、803,680个任务的EvoWorld-Bench基准,在仿真与真机实验中相比所评估基线提升了导航成功率与搜索效率。
  7. arXiv

    自演化搜索智能体出现“共同作弊”:内部奖励上升而真实正确率停滞,CrossFit 把假一致率从 6.1%/8.8% 降到 3.0%/3.7%

    该工作诊断了自演化搜索智能体中的“共同作弊”失效模式——出题者(proposer)与解题者(solver)在共享错误上越来越一致,使内部奖励上升而外部正确率停滞,并提出多样本验证(MSV)与主方法 CrossFit(按来源文档分折、用互补折训练的辅助解题者给提案打分),在 Qwen3.5-4B/9B 上把假一致质量从 6.1%/8.8% 降至 3.0%/3.7%,在七个下游搜索基准上平均 Cover-EM 相比标准耦合自演化提升 8.8/8.4 个百分点。
  8. arXiv

    RRT用项目反应理论把评分表判定转成质量奖励,在Qwen3.5-4B上比GRPO高1.7分并省下约一半评判请求

    该工作提出Rubric Response Theory(RRT),把评分表准则的通过/不通过判定视为对同一潜在质量的项目反应证据,用两参数项目反应模型推断每条 rollout 的质量作为GRPO奖励,并用Response Parameter Network从提示与准则文本预测准则难度与区分度、以在线EM随策略更新,在Medical、Science、Rubrics as Rewards Science与RubricBench四个数据集上以Qwen3.5-4B为策略时宏观准则得分比GRPO高1.7分,在Medical与Science的Hard与Very hard准则上高2.8至5.6分,且在准则预算减半时自适应Fis
  9. arXiv

    BIABench用16项已发表研究检验AI智能体:常规分析可完成,3D与时间序列任务得分跌至0.00–0.10

    研究者构建了BIABench,把16项已发表生物学研究还原为原始图像加生物学家指令的端到端生物图像分析任务,用研究自身报告的结果作真值、以确定性指标评结果分并用VLM按专家撰写的评分细则评过程分,在6个智能体、多个模型与两种指令详细度下各重复三次,发现常规2D任务最高可达0.97,而5D核孔定量与3D致癌点状结构定量在所有配置下都不超过0.25。
  10. Google DeepMind News

    SynthID Bio 概念验证:为 AI 生成的蛋白质加入水印并保持其生物功能

    该工作提出并验证了 SynthID Bio 这一概念验证方案,用于对 AI 生成的蛋白质进行水印标记,同时在标记后保持蛋白质的生物学功能。

第 12 页 · 当前显示 10 项