AI 核心
915 条内容
A2Z GameSpec-Bench 用 100 份长文档 GDD 检验编码智能体:可编译率近 99%,但整体 GDD Fidelity 最高仅 77.0
该工作提出 A2Z GameSpec-Bench,用 100 份长文档游戏设计文档(GDD,Small 与 Big 各 50 份,平均 14,085 与 26,297 tokens)把每份 GDD 转成固定的依赖感知契约,再以源码检查、场景回放与自适应试玩三条通道评估编码智能体端到端生成游戏的忠实度,结果显示可编译可运行并不等于忠实实现(如 Claude-Fable-5.1 可验证率 98.7% 而整体 GDD Fidelity 为 77.0),依赖上下文把已记录试玩违规的覆盖从 71.1% 提升到 80.2%,需求级反馈两轮后相对自我修订把 Big GDD 上的整体 GDD Fidelity 提升 10.9%。
LANTERN 用 Qwen3-32B 隐藏状态在 8 小时内从 OEIS 5000 万对序列中筛出 62 条已验证关系,其中 4 条未见于 OEIS 与定向文献检索
LANTERN 在预训练模型 Qwen3-32B 的激活上训练线性分类器,对 OEIS 中 1 万个高频引用序列构成的 5000 万对候选关系排序,再经廉价过滤、假设生成、可执行验证与解析检查,产出 62 条此前无 OEIS 交叉引用的已验证关系,内容筛查保留 13 条、其中 9 条具信息性或洞察性,4 条未见于 OEIS 与定向文献检索,端到端耗时不足 8 小时。
LSD 用在线自蒸馏把已解出题目的多余长度从 19.0% 压到 -3.7%,同时保持或提升 Pass@1
该工作把强化学习后训练中「已解出查询的响应被无谓拉长」定义为长度缩放税(LST),并提出长度自蒸馏(LSD):用当前 rollout 组的正确率把已解出提示路由到在线策略蒸馏、未解出提示保留原 RLVR 目标,教师是同一策略谱系的指数滑动平均检查点、无需外部模型,在单轮推理上把 LST 从 19.0% 降到 -3.7%、在多轮智能体任务上从 31.4% 降到 13.7%,同时平均 Pass@1 与 RL 相当或更好。
ReaLVR 用视觉证据监督潜空间推理,在 Qwen2.5-VL-7B 上取得 63.7% 五任务均值并把潜空间视觉推理扩展到 235B
该工作先分析潜视觉推理(LVR)中潜 token 的行为,指出存在“潜证据—信用缺口”——潜 token 对改变正确答案的图像扰动反应很弱,并认为这源于 GRPO 训练缺少显式监督;为此提出 ReaLVR,在模型自身自由运行的潜轨迹上引入视觉证据监督,用正确与错误答案的对比决定哪些位置需要更强监督、用相关与不匹配视觉证据的对比决定应保留什么,在三个模型家族上一致优于所评估的 LVR 基线,Qwen2.5-VL-7B 上五任务平均达 63.7%,并首次把潜空间视觉推理扩展到 235B 参数规模。
RoboCoach 用世界模型想象失败来挑选示范:仅 150 条子任务示范把 Franka 成功率从 13.3% 提到 75.0%
该工作提出 RoboCoach,一个由世界模型引导的主动教练框架,其 Route–Imagine–Diagnose–Improve(RIDI)循环让可复用技能专家在共享动作条件世界模型 CoachWorld 中闭环执行,用进度判定器记录首个未完成的子任务,再据此决定采集哪些子任务示范、更新哪些专家适配器;在 LIBERO 与 RoboTwin 两套仿真和 Franka 与 AgileX 两个真机平台上,想象成功率与实机成功率在 22 个任务–策略对上 Spearman 相关为 0.840,每平台仅增加 150 条子任务示范后 Franka 成功率由 13.3% 升至 75.0%、AgileX 由 40.0% 升至 83.8%,并在四个留出组合上取得
SpatialCORE 把「框得准不准」和「框得自不自信」一起写进奖励,8B 模型在 OmniSpatial 与 SpatiaLab 上超过同规模开源与专用空间推理模型
SpatialCORE 是一个基于 GRPO 的后训练框架,它用模型自身生成 grounding(边界框)时的坐标 token 不确定性来加权几何匹配质量,并用答案门控把 grounding 优化与最终答案正确性绑定,使模型学会从「既准确又自信」定位到的任务相关物体出发进行空间推理;在 OmniSpatial 留出测试集上 SpatialCORE-8B 取得开源与专用空间推理模型中最高的加权平均准确率,并在未参与训练的 SpatiaLab 上零样本领先,消融显示去掉置信度加权后准确率从 56.33% 降到 52.33%。
Merriam-Webster 收录 agentic、vibe coding 等 AI 词汇,Nature 同期报道 Google DeepMind 用 SynthIDBio 给 AI 生成蛋白质打水印
Nature 报道称 Merriam-Webster 于九月新增 agentic、AGI、natural language processing、prompt engineering、vibe coding 等 AI 与计算术语以及 biohack、direct air capture、geoengineering、uncanny valley 等技术词,词典编纂者 Peter Sokolowski 指出这批词需要较专业知识才能理解,认知科学家 Lera Boroditsky 认为技术加速推动语言变化;同一证据包中的 Nature 论文则提出 SynthIDBio,用 SynthID-text 的 tournament sampling 改造 Prote
Jev 在 Amazon 三域重排中保持高 NDCG@10,延迟随候选集增大增长远慢于点式 Qwen
该研究在 Amazon Reviews 2023 的 Movies and TV、Video Games、Books 三个域上,用 SASRec 检索出的高排名负例构造受控困难候选集(候选规模从 10 到 100),把被 TypeSafe AI 称为“System One Model”的决策导向模型 Jev 与 SASRec、DCNv2 以及 Qwen2.5 7B Instruct 的点式与列表式重排器对比,发现 Jev 在保持较强推荐效果(NDCG@10、Hit Rate@10、MRR)的同时,其观测服务延迟随候选集增大的增长明显比点式 Qwen 更平缓,但仍远高于推荐专用模型。
SMART 用自进化多智能体把整季字幕翻译做成长程状态任务,在 15 个方向上取得最低 SubMQM 惩罚
该工作提出 SMART,一个面向长篇字幕翻译的自进化多智能体系统:在测试时训练阶段构建持久化的剧集级记忆,通过动态图路由与 Mixture-of-Agents 层翻译一部分句子,并借助术语核验、字幕约束校验与上下文检索工具,由 judge-refiner 循环把文本批评回传以更新智能体提示与路由策略而不重训底层 LLM;测试时推理阶段用演化后的配置翻译剩余内容,同时发布覆盖 14 个类型、每剧 2–198 集、制作年份 1959–2023、15 个目标语区的 Subtitle Arena 基准与含 7 个维度、19 类错误的 SubMQM 评估框架,结果显示 SMART 在全部 15 个 Subtitle Arena 方向上取得最佳 Overall
第 10 页 · 当前显示 10 项