跳到主要内容
返回时间线
arXiv来源发表:

CRD 用多教师互评与步骤级拼接蒸馏推理能力,4B 学生模型在 MATH-500 达 97.3%、AIME'25 达 70.3%,仅用 50K 训练样本

核心概要

该工作提出协同推理蒸馏(CRD)框架,让 DeepSeek-R1 与 Gemini 2.5 Flash Thinking 两名教师迭代互评彼此推理、由双评判模型对每一步给出与最终答案无关的质量分,再用 Viterbi 式连贯性感知算法跨教师拼接高质量步骤,并以推理质量优化(RQO)配合课程式长度约束训练学生;CRD-4B 在 MATH-500 达 97.3%、AIME'25 达 70.3%,仅用 50K 训练样本。

Source-provided article image: Collaborative Reasoning Distillation via Cross-Feedback and Coherent Curation
Figure 1 ·

Figure 1 : Overview of the CRD Framework. Multiple teachers iteratively critique and refine each other’s reasoning through Cross-Feedback . An LLM-as-a-Judge then assigns step-wise quality scores, and the Thinking Path algorithm stitches high-quality steps across teachers while pruning flawed steps. The curated dataset is used to train students via RQO with Optimal Budget curriculum.

arXiv

深度剖析

交互式多教师交叉反馈让教师互相审阅并修正对方推理链,显著提升候选数据质量:数学推理准确率从 64.1% 升至 83.5%,代码生成成功率从 52.3% 升至 73.9%。 以往多教师蒸馏依赖简单聚合或集成投票,本文改为迭代互评,利用 DeepSeek-R1 与 Gemini 的互补错误画像进行相互纠错。 消融实验显示交叉反馈带来 +3.4%–7.1% 的学生性能提升,其中 AIME'25 +7.1%、LiveCodeBench +5.9%;附录 G 显示性能在第 2–3 轮收敛。

步骤级质量评估用 JudgeLM 与 xVerify 双评判、每步评两次、取 25% 截尾均值,给出与最终答案无关的连续质量分,使错误解法中的高质量步骤也能被识别。 标准蒸馏只用二元正确性或格式合规作为学习信号,无法区分严谨推理与侥幸猜对;本文把奖励信号细化到每一步。 消融显示双评判配置在 MATH-500 上带来 1.4 分提升,优于单用 xVerify(0.6)、单用 JudgeLM(0.4)或单用 GPT-4o(0.6);与 GPT-4o 重评的平均绝对差为 0.428(0–10 分制)。

连贯性感知步骤拼接(Thinking Path)在质量与语义连贯之间做联合优化,构造跨教师混合推理链;在 2,694 个拼接前错误的题目中,528 个(19.6%)在拼接后变为正确。 链级方法会整条丢弃含单步错误的解,本文按步抽取有效步骤并与其他教师的正确步骤组合,产生任何单一教师都无法独立给出的解。 消融显示 Thinking Path 贡献 +1.1%–3.5%;连贯—质量权衡参数取 0.7(70% 质量、30% 连贯)时最优,过高或过低分别降至 76.0% 与 82.3%。

在 50K 精选样本上以 RQO 训练学生,CRD-4B 达 MATH-500 97.3%、AIME'25 70.3%、LiveCodeBench 57.4%;CRD-30B-A3B 在数学与代码基准上超过其教师 DeepSeek-R1。 相比 220K–800K 样本的同类方法,本文用约 12 倍更少的最终训练轨迹达到更强性能,1.5B 学生仅需 1,632 步、8.8 H100 GPU 小时。 同数据朴素 SFT 已达 MATH-500 90.5%,说明增益主要来自数据精选,RQO 再平均加 1.15 分;与 TinyLLM、FAIR、MAGDi 在相同数据下比较,MATH-500 领先 MAGDi 18.5%。

启示与展望

该框架面向希望以有限算力获得较强推理能力的小模型训练场景:学生规模覆盖 1.5B、1.7B、4B 与 30B-A3B MoE,教师为 DeepSeek-R1 与 Gemini 2.5 Flash Thinking,训练数据为 50K 条来自数学、代码、逻辑与 STEM 的精选样本。它适用于数学、代码、研究生级 STEM 与规划类基准,并可与测试时扩展互补——Optimal Budget 课程(32K→10K→1K)旨在让学生以更少 token 完成推理,利于延迟敏感部署。对采用类似多教师蒸馏流程的团队,其可复用部分是步骤级质量评分与连贯性感知拼接这两步,而非特定教师组合。

CRD 依赖 LLM 教师与评判模型,可能继承其偏差,看似合理但错误的步骤偶尔仍会获得高分;拼接只保证在质量与连贯准则下得分高,并不保证每条被选链在逻辑上正确。实验只覆盖一对教师(DeepSeek-R1 与 Gemini 2.5 Flash),其他教师组合尚待探索;报告的训练成本只含学生优化,不含教师生成与数据精选。RQO 与同数据朴素 SFT 做了对照,但未与 DPO 比较。当前评分标准为静态规则,跨领域扩展性有限,未来方向是转向基于偏好数据学习的质量模型。此外,正文中若干公式与图 4 的具体数值在解析文本中缺失,若需精确复现超参数与曲线细节,应查阅原文图表。

来源