Allspark 让弱模型教师通过交替思维链把推理能力传给冻结的强模型,ARC-AGI-2 上准确率从 78.1% 升到 81.6%
核心概要
该工作提出 Allspark 训练与推理框架:训练时让一个弱教师模型与同源冻结副本交替续写同一段推理链、由冻结副本给出最终答案,仅用弱模型 rollout 更新教师;推理时把冻结副本换成更强的学生模型并保持双方权重不变,在 Qwen3-1.7B/4B 的数学与推理任务以及 Inkling-Small 教师对 Inkling、Kimi-K2.6、Nemotron-3-Ultra 的 ARC-AGI-2 评测中观察到准确率提升,并给出准确率与保留 token 的权衡刻画。
深度剖析
Allspark 把弱到强迁移的接口放在共享文本上:训练阶段弱教师与同源冻结副本轮流生成推理片段,冻结副本产出最终答案,任务奖励只更新教师生成的推理 token,学生 token 与插入的边界标记被掩码。 与需要采样并更新强学生的在线策略蒸馏(如 Direct-OPD、W2S-OPD、OPRD)不同,这里训练期完全不使用强学生 rollout;与弱到强搜索、CoWeST、Co-LLM 等冻结强模型的引导方法相比,这里训练的是一个可复用的弱教师,而不是一次性搜索或偏好信号。 论文给出交替推理的形式化定义、教师片段“续写价值”的期望表达式,以及 Qwen 与 Inkling 两套训练协议(LoRA、掩码规则、异步有界滞后、长度上限)的完整描述。
受控 Qwen3 实验显示,用 Allspark 教师引导冻结的 Qwen3-4B 学生时,数学约持平、推理提升:数学 96.1 对单独 96.9,推理 82.8 对单独 81.2;而未训练教师(93.0/79.7)与普通 RL 教师(89.8/79.6)在两个域都低于学生单独表现。 这组消融把“教师是否经过交替式训练”与“教师是否只是被 RL 训练过”区分开,说明收益并非来自任意弱模型提示,而来自与冻结伙伴共同训练出的教师。 每个域 128 道开发题、每题一个采样答案,配对条件共享题目、学生解码设置与推理/答案上限;作者自己称其为“a sign of life”,属于小规模受控证据。
在 ARC-AGI-2 的 96 道开发题上,Inkling-Small 教师引导冻结的 Inkling 学生取得 81.6% 平均 pass@1,高于学生单独的 78.1%;在 10.8k 保留 token 时达到 79.2%,超过学生单独在 12.3k token 时的最佳 78.1%。 这是把弱到强迁移放到一个以抽象推理著称的基准上,并同时报告准确率与保留 token,使“准确率—token 权衡”成为可比较的对象,而不只是单点准确率。 每个配置 96 道题、每题三次尝试、共享任务—尝试种子,报告 288 次尝试的平均 pass@1;作者同时说明 token 统计按各写作者的原生分词器计算,不是统一分词器预算。
同一个 Inkling-Small 教师可直接复用于其他模型家族:Kimi-K2.6 准确率提升 11.5 个百分点且保留 token 减少 7.7%,Nemotron-3-Ultra 在 medium 与 full 思考模式下分别提升 17.7 与 5.2 个百分点但 token 使用增加。 跨家族迁移依赖文本交接——每段推理用写作者分词器解码、去掉模型特有控制标记,再用接收方分词器重新编码进其原生推理通道,因此不要求共享词表或架构。 三个操作点各 288 次尝试、任务—尝试种子配对,报告任务级 bootstrap 区间;作者指出收益随目标学生的推理设置变化,且 token 总量不是统一分词器预算。
启示与展望
该结果面向希望在不生成强模型 rollout 的前提下复用弱模型 RL 收益的研究与工程场景:训练只需弱模型算力,教师训练完成后可固定并用于多个冻结强学生,适用于暴露可中断推理流的思考型模型接口。论文给出的适用面覆盖 Qwen3-1.7B/4B 的数学与推理任务,以及 Inkling-Small 教师对 Inkling、Kimi-K2.6、Nemotron-3-Ultra 的 ARC-AGI-2 评测;跨家族迁移依赖把推理文本按接收方分词器重新编码,因此不要求共享词表。作者把这一路线定位为降低 RL 研究门槛,并希望其延伸到对齐与 AI 安全研究。
作者自述实验算力有限,评测覆盖的模型、任务与训练轮次都受限,更广泛的研究才能确立收益的稳健性与普适性;推理阶段需要同时服务教师与学生,额外的模型调用与交接可能增加成本与延迟,因此保留 token 的下降不一定转化为部署成本下降;实现依赖中断与恢复共享推理流的能力,对非思考型模型或未暴露合适推理流的接口尚未测试。Qwen 部分为单种子受控实验,作者称其为“a sign of life”;跨家族评测中目标学生使用各自原生思考渲染器,不假设不同家族间数值 effort 或推理算力等价,且 token 总量按各写作者原生分词器计算,不是统一分词器预算。案例研究被作者明确说明只展示交换内容,不确立单个教师片段的因果效应。
