决策模型不再一次定答案:同一套层循环八次,1.4B模型逼近三倍参数的单次模型
导语
把预训练就带循环的语言模型改造成类型化决策模型后,同一套层反复跑八次,在10,027道测试决策上把准确率从58.4%提到72.0%,代价是7.7倍算力。
正文
类型化决策模型可以靠循环同一套层来换取准确率,而不必增加参数或生成文本。调用方声明选项,模型只返回每个选项的概率;把同一套层递归地作用在自己的输出上,模型在给出答案前多改几次隐藏状态。 此前这类模型一次前向就定答案,算力对每道题固定;要处理需要多步依赖的决策,只能换更大的模型或改成生成式推理,后者会放弃类型化契约并增加延迟。 在10,027道来自59个来源的测试决策上,循环版达到72.0%,比同形状、同配方、同数据的非循环模型高13.5个百分点,比同尺寸的更新非循环模型高5.3个百分点,比参数三倍于它的单次模型低1.8个百分点。
每个循环都被读出并单独训练,因此一个模型能服务从一次到八次的所有算力预算。 只训练最后一个循环时,早期循环会塌掉,第一次循环只有35.6%的准确率,而逐循环训练让第一次循环就达到58.4%。 训练用交叉熵与Brier分数之和,读出端只训练LoRA适配器和每个循环的小读出头,共61M参数,主干保持冻结;在1.4B主干上训练八次循环,读出在第三次循环时已拿到从第一次到第八次全部增益的88%。
接下来
下一步可以尝试为每道题选择循环次数:有11.7%的题目在某个循环上是对的、在第八次循环上却是错的,这给任何循环选择规则设了上界。做自动决策的团队可以在接受、升级、路由这类调用上按算力预算读取不同循环,三次循环已给出大部分增益。
结论建立在Ouro这一族预训练就带循环的主干上,多数分析用1.4B模型,能否推广到其他和更大的循环主干仍是待答问题。循环用算力换准确率:八次循环约是Qwen3.5-4B的3.3倍GPU时间,四次约1.6倍。推理深度分析只基于两个程序生成的任务,验证器案例只用了一个数据集和一个生成器。测试套件是英文的,由既有数据集拼成,其题型配比是作者的选择,也无法排除某个主干在预训练时见过这些公开数据集。
