FlyBy让4B小模型在知识瓶颈处定向查询强模型,在1158道难题上以2.7倍更低成本超过Qwen3-14B
核心概要
该工作通过对两个模型家族、多个规模的中介推理状态做反事实干预,发现自我反思主要把概率质量集中到当前状态已可达的解上,而非让新解变得可达,并据此区分执行瓶颈与知识瓶颈,提出FlyBy选择性查询框架,训练4B与8B模型先推理、再诊断未解决之处、在知识瓶颈处查询参数知识更强的外部模型,在六个基准的1158道难题上FlyBy-4B取得45.96% pass@8,超过Qwen3-14B的41.64%且服务成本低2.7倍,FlyBy-8B进一步提升至51.81%。
深度剖析
研究把小型推理模型的失败拆成两种可操作的机制:执行瓶颈中正确路径在模型自身推理下仍可达、反思可以恢复;知识瓶颈中进一步推理不足,而相关外部信息能让正确路径变得可达。 此前关于自我精炼与测试时计算的工作多把失败归因于模型未识别不确定性或未有效分配推理努力,本文用中介推理状态上的配对反事实干预把这一边界操作化,并以状态价值是否为零来区分两类瓶颈。 在Qwen3-0.6B/1.7B/4B/8B/14B与Gemma4-E2B/E4B/12B共八个模型上,对AIME25/26与HMMT-Feb2026的93道竞赛题及GPQA-Diamond采样16条、每条最多32K token的轨迹,识别13.4K次内生认知言语化,产生215K条反事实续写与57K条信息条件续写,合计272K条续写。
自我反思在小模型上并非缺失,而是难以转化为进展:认知言语化在小模型中依然常见,但其对状态价值的因果效应随规模显著增大,反思主要提升不确定状态与执行类状态的价值并降低答案熵。 这修正了“小模型只是没注意到自己的不确定性”的自然假设,把限制定位在把反思转化为进展的能力上,而非表达不确定性本身。 基于固定九词认知言语化词表的内生出现频率统计,以及对每个rollout均匀抽取四次言语化事件的配对干预(对比禁用该词后的解码),并报告价值与答案熵的变化。
相关外部信息能填补知识缺口,但小模型在两侧都受限:它们更常进入知识类状态,且即便获得相关信息也更不善于将其并入正在进行的推理。 与“参数知识更弱因而从外部信息获益更多”的直觉相反,信息利用能力总体随模型规模提升;同时知识类状态在科学推理中比数学推理中更普遍。 在错误轨迹的相对位置0.25/0.5/0.75处分别插入认知提示、由DeepSeek-V4-Pro生成的不泄露答案的oracle信息提示、以及来自无关问题的随机提示,随机提示收益很小、认知提示收益有限、相关信息收益明显更大;规模趋势在限制到与相邻更小模型共享的问题集后依然保持。
FlyBy把外部模型暴露为推理轨迹内的多深度查询动作,先推理、诊断未解决之处、再决定是否查询、问什么、花多少外部算力,在难题上超过更大的模型且成本更低。 与直接优化工具使用、检索文档或推理前一次性查询强模型的方案不同,该方法先诊断当前状态属于哪类瓶颈,再获取针对性信息;SFT仅用95条救援轨迹引导查询动作空间,随后用成本感知强化学习校准查询时机与深度。 在六个基准的1158道难题上,FlyBy-4B从基座Qwen3-4B的21.2%提升到46.0% pass@8,超过Qwen3-14B的41.64%且服务成本低2.7倍,pass@1为16.85%高于Qwen3-8B的15.31%;FlyBy-8B将pass@8提升到51.81%;在Qwen3-4B十六次无工具rollout均未解决的问题上FlyBy-4B达到28.7% pass@8;查询平均仅105个输出token,而Search-R1平均返回2015字符;在50道SuperGPQA问题上查询使状态价值平均提升5.30个百分点,而追加推理几乎没有提升。
启示与展望
该结果面向以小型推理模型为认知核心、可访问更强外部模型的部署场景,适用于数学、科学、通用知识与医学等难题推理;方法依赖外部API可用性,并在训练与评估中通过禁止外部模型看到原题、拒绝与问题n-gram重叠过高的查询、以及从工具观测中抹除答案片段来控制答案泄漏。对希望以更低服务成本获得更高难题覆盖率的团队,这一框架给出了“先推理、再定向查询”的可训练模板;对关注隐私与延迟的场景,论文把隐私感知的选择性查询列为未来方向。
知识瓶颈的判定是操作性的:论文明确说明零成功续写是有限样本标准而非绝对不可达,在更大续写预算下部分状态会出现成功续写,但这些状态仍保留较大的干预差距。外部模型自身可能给出错误或幻觉信息并传播到后续推理,论文将其列为局限。查询策略在替换后端后性能略有下降(43.21%与43.96%对45.96%),提示后端特性仍有一定影响。此外,本次读取的文本包含摘要、正文与附录,但图表以文字描述形式出现,具体图示细节需回到原文核对。
