AI 核心
903 条内容
800个模型预训练显示:野生AI网页文本在数据充足时抬高损失,31.1%的AI占比需多花1.6倍算力
研究者用EditLens与Pangram标注2021至2026年的Common Crawl网页数据,发现2026年6月通过FineWeb质量过滤的token中有27.5%为AI生成、8月升至31.1%,并预训练800个19.9M至973M参数的模型、改变AI与人类token比例,拟合出含独立收益项与损害项的新缩放律:AI token对数据匮乏模型先降损失后饱和反转,对Chinchilla最优预算模型几乎立即抬高损失,该律在留出规模上预测误差低于11个已有缩放律,并据此估算按2026年8月AI占比训练需1.6倍算力。
冻结7B主干、只训10万偏置参数:无标签TTRL在MATH-500达76.67%,并迁移到4500道未参与优化的问题
该工作提出无标签的偏置-only测试时强化学习:冻结预训练主干,仅用多数投票伪标签作为奖励、只优化约10万个偏置参数(28层MLP的down_proj.bias),在MATH-500上Qwen2.5-7B达76.67%、Qwen2.5-Math-7B达79.50%,同一流程还改善视觉语言与音频推理,冻结后的偏置向量在4500道验证互斥MATH题上把Qwen2.5-7B从46.3%提升到70.9%、Qwen2.5-Math-7B从52.5%提升到75.4%,并从伪标签可靠性与可及梯度能量两方面解释受限子空间为何仍能有效适配。
让 Builder 学会设计执行环境:元技能让固定权重智能体宏平均分提升 8.95 个百分点
该研究提出“元技能”(meta-skill)——即规定何时需要支持、提供何种资源、Target 应如何使用这些支持的原则——让 Builder 在 Builder 与 Target 权重均固定的条件下,从 Target 在开发集上的执行反馈中学习这些原则,冻结技能库后为未见任务构建 harness;在 Harness-Bench 与 NewtonBench 上,全库元技能相对无技能构建使宏平均分提升 8.95 个百分点,相对把同一技能库直接交给 Target 提升 12.02 个百分点。
南科大与港城大提出Box2-Bench:前沿模型用得上好工作流,却在坏工作流下最多掉43.3分
作者提出Box2-Bench,在固定模型与任务的前提下只改变工作流的可用性与可靠性(无、好、坏、部分、混合五种匹配条件),发现Gemini 3.7 Flash、DeepSeek V4 Flash、GLM 5.2等前沿模型在12个模型–任务对中8对受益于好工作流、12对全部被坏工作流拉低(降幅3.3至43.3分),且混合条件在12对中10对低于匹配的部分条件;随后仅用坏工作流训练两个开放权重模型,反事实SFT把坏工作流惩罚从20.0分降到6.7分(AIME)和从9.8分降到0.6分(WebShop),但削弱了对留出好工作流的利用,结果奖励RL又把AIME上的利用率从-3.3恢复到+6.7,并在多智能体协作
RIDE 把 RL 教师的隐藏状态残差外推,在四个基座/教师对上均值追平或超过教师
该工作提出 RIDE(RL-Induced Direction Extrapolation):在学生自采样轨迹上,逐层计算 RL 教师与其 RL 前检查点之间的隐藏状态残差,把学生的表示回归目标沿该残差外推到教师之外,在四个基座/RL 教师对(R1-Distill-1.5B、Qwen3-4B、Llama-3.2-3B、Phi-4-mini)上于 AIME24、AIME25、AIMO 的 Avg@16 均值均接近或超过 RL 教师,是唯一均值做到这一点的对比方法,并一致优于输出空间外推。
Soft Spatial Reasoning 用 AdaptSoft 按步调节软思考温度,在 OmniSpatial 上把加权平均准确率提到 49.68
该工作提出 Soft Spatial Reasoning 后训练框架,让大型视觉语言模型在空间推理的每个思维链步骤用混合 token 嵌入的连续软状态代替硬性选择单个 token,并用 AdaptSoft 控制器依据当前隐藏状态与预测不确定性逐步调节软度,配合梯度对齐目标训练;在 OmniSpatial、SpatiaLab、MindCube 三个基准上,其加权平均准确率均高于同骨干的硬思考与固定软度思维链基线以及所比较的现有模型。
RSIGame 用局部探索-诊断-改进加全局最优检查点,把 Qwen3.8-27B 在 Godot 上从 37.07 提到 61.38,超过 GPT-5.5 单次生成的 50.26
RSIGame 把自动游戏开发组织成递归自我改进:局部 explore-diagnose-improve 循环广泛探索可执行游戏、诊断并排序问题、基于证据修改,并用不断增长的检查清单累积测试与改进指引;全局循环跟踪整体质量、保留最佳检查点并检测饱和或回退;此外把成功的开发经验通过监督微调内化进生成器,在 140 个 GameCraft-Bench 任务、Godot 与 Phaser 两个引擎、五个生成器上于同等开发预算下持续提升游戏质量,其中经验内化使 Qwen3.8-27B 在 Godot 达到 61.38、在 Phaser 达到 58.53,超过 GPT-5.5 单次生成分数并把 Qwen 的生成 token 减少 11 倍。
LoopVL 用共享参数循环 128 层,在 MMStar 上把 1B 骨干从 55.33 提到 63.47,并观察到跨循环的 Visual Aha Moment
作者提出 LoopVL,把循环 Transformer 扩展到视觉语言模型:语言骨干基于 HRM-Text 开源框架与数据自行预训练,采用 Module-Loop 与 Model-Loop 嵌套的 H/L 共享参数结构,默认 H2L3 配置下一次前向执行 128 次 Transformer 层调用;在相同 0.14T token 训练预算下,LoopVL 在 MMStar、RealWorldQA、ChartQA 等基准上超过同层数的 Transformer-VL 1B,并接近或超过更大的 4B 稠密基线,同时作者报告了跨模型循环的视觉注意力重分配现象,称为 Visual Aha Moment。
EviRover 让 4B 模型学会“多看一眼”:在 EviLens 上比基座平均提升 30 分,BrowseComp-VL 提升 15 分
该工作提出“证据不足下的感知”设定,把定位、分割、计数等感知任务重构为主动搜寻证据的智能体过程,构建两条数据生成流程得到 EviRover-SFT-5K 与 EviRover-RL-12K,并发布含 688 个实例、覆盖五类感知任务的人工核验基准 EviLens;经监督微调加智能体强化学习训练的 4B 模型 EviRover 在 EviLens 上比其 Qwen3-VL-4B-Instruct 基座平均提升 30 分,接近先进闭源模型水平,并在 WebEyes、ReasonSeg、RefCOCOg、MMMU、MMMU-Pro、MathVerse 以及 BrowseComp-VL(提升 15 分)上取得迁移收益。
第 5 页 · 当前显示 10 项