FLaRe用流匹配在潜空间做推理,五项探针全面超越既有潜推理方法,并以四分之一延迟达到显式思维链97%准确率
相关研究与后续进展核心概要
作者提出潜推理的五项要求(有用、多样、可解释、可精化、高效),并给出基于学习潜空间中流匹配的配方FLaRe:用符号思维链训练VAE、对输入与潜码加扰动、把流训练集中在接近纯噪声处、答案读取器同时读加噪码与模型自身预测、再用自验证 rollout 自训练;探针显示FLaRe在五项要求上均优于Coconut、CODI、PCCoT,在算术基准上表现更好,并以约四分之一延迟达到显式思维链97%的准确率。
深度剖析
提出潜推理的五项要求——有用、多样、可解释、可精化、高效——并为每一项设计探针。 此前工作多以准确率或效率单一指标评价潜推理,缺少对“思维是否真正被答案使用”“重采样是否探索不同轨迹”等性质的系统检验。 在GSM8K测试集上以Llama-3.2-1B-Instruct为骨干,与Coconut、CODI、PCCoT及显式思维链对照;双胞胎测试使用824对只改一个数字的问题,采样测试每题16个样本,可解释性测试检查参考中间值是否按序出现。
给出使潜空间流匹配真正可用的训练配方FLaRe,覆盖潜空间编码、流训练、答案读取与自训练四个环节。 标准文本扩散式流水线在推理任务上远落后于显式思维链,作者通过受控消融定位出关键选择:符号思维链输入与双解码路径、三种扰动、时间分布偏向噪声、答案读取器读自身预测端点、以及第二阶段在自验证 rollout 上自训练。 消融覆盖66个VAE、多种时间分布、五种答案读取设置、多种训练数据组合与第二阶段各组件;默认配置为8个潜槽、Llama-3.2-1B编码器与微调后的3B解码器,流模型为Llama-3.2-1B-Instruct。
FLaRe在五项要求上均优于既有潜推理方法,并在算术基准上取得更好准确率与效率。 既有方法在双胞胎测试中跟随注入思维的比例为7%至32%,重采样几乎不提升覆盖率,且推理预算受训练预算限制;FLaRe第二阶段在干净双胞胎对上跟随率达76%,解码读法pass@16提升14.7点,预算从十分之一步增至二十步时解码准确率由36.6升至62.6。 在GSM8K、GSM8K-Hard、SVAMP、MultiArith上以0.5B、1B、3B三种骨干对比;延迟测试在单张RTX 3090上逐题计时,第二阶段直接读法两步达到57.4,约为CODI一半、显式思维链四分之一的延迟。
第二阶段自训练只需新问题与参考答案,无需额外思维链标注、学习奖励或强化学习目标。 相比依赖思维链课程或蒸馏的既有方法,该阶段用模型自身生成、经冻结解码器验证答案正确的思维重新编码为流目标,并把答案损失反传到完整 rollout。 消融显示去掉答案损失会退回第一阶段水平,切断 rollout 梯度损失2.3点直接准确率,单步 rollout 损失2.8点,去掉验证损失2.0点;其余变体与完整第二阶段相差不到1点。
启示与展望
该配方面向以符号思维链为监督、答案可自动校验的算术类推理任务,默认设置使用8个潜槽、Llama-3.2-1B编码器与微调3B解码器,流模型为Llama-3.2-1B-Instruct,训练数据为GSM8K-Aug与Diverse CoT。对只有自然语言思维链的数据集,作者给出用LLM转换为符号形式的离线流程。变长潜思维在GSM8K-Aug上未带来增益,因为8个槽已能精确重建98.7%的测试思维链,作者预期在思维链长度差异更大的数据上才有用。第二阶段只需新问题与参考答案,不需要额外思维链标注、学习奖励或强化学习目标,适合在已有答案校验器的场景中复用。
探针中的双胞胎测试与可解释性检查依赖参考思维链的中间值,对走其他正确路径的思维会记为未命中,因此可解释性数字是偏保守的下界。第二阶段验证只比较解码思维链的最终答案与参考答案,不校验中间步骤。SVAMP上表现是主要例外,作者归因于该数据集近半问题含干扰数字,而GSM8K-Aug中这类问题少见。变长潜思维在GSM8K-Aug上未显示增益,其价值有待在思维链长度差异更大的数据上检验。符号转换流程依赖一个LLM转换器与人工设定的符号语言规则,转换质量对下游的影响尚未单独量化。
