跳到主要内容
返回时间线
arXiv来源发表:

LinkedIn与多校团队发现:7B到72B学生模型用更小的冻结模型生成拒答,代码与数学表现反而更好且算力更省

核心概要

该研究在SODA式两阶段偏好蒸馏流程中固定提示、优选回答、SeqKD初始化、DPO目标与训练预算,只改变拒答来源,发现7B至72B的Qwen2.5学生在代码生成与数学推理上,用参数更少、推理算力更低的冻结Base模型生成拒答,比用学生自身拒答训练出的学生更强,并进一步用线性化特征模型给出有限时域效用界,提出混合来源、提示重分配与词元置换、按参考策略似然重选三类干预。

AI-generated editorial illustration: Smaller Models, Better Rejects: Preference Distillation Scaling

深度剖析

研究确立了一个跨规模的偏好蒸馏现象:在7B、14B、32B、72B四个学生规模上,所有更小的冻结Base来源在代码生成avg@4上都优于vanilla Self与post-SeqKD Self两种自生成拒答构造,数学推理上14个含更小Base来源的Qwen配置中多数超过Continued-SFT。 以往偏好蒸馏默认把教师回答作为优选、学生自身回答作为拒答,隐含假设自生成失败是最有信息量的负样本、且拒答必须来自与学生同等规模的模型;该工作把拒答生成分布当作独立设计变量,并在同一协议下只改变拒答来源。 代码线使用KoDCode的75,752条SeqKD提示与24,248条不相交偏好提示,每个拒答都经执行验证至少失败一个单元测试,在5,000道留出题与BigCodeBench、HumanEval、MBPP上评估;数学线使用OpenR1-Math的33,524条SeqKD提示与12,288条偏好提示,在MATH-500与AIME上评估avg@4。

研究把拒答来源选择形式化为逆数据设计,在线性化特征模型的DPO分析中导出有限时域效用界,用转移质量与不利份额两个坐标刻画来源,并给出有利区域条件。 既有工作多在选择或加权已观测配对、或把数据生成与训练耦合,而该分析直接刻画何种拒答分布能提升给定学生的任务效用,并由此推出三个可检验的构造干预假设。 推导基于SeqKD参数处的网络分数梯度作为固定响应特征,在共享初始化附近做局部线性化,命题在特征有界等正则条件下给出显式修正项;完整构造与证明置于附录。

三项干预分别得到支持:随机混合更小Base与vanilla Self拒答时,代码avg@4随更小Base份额上升而提高;把真实Base拒答重分配到其他提示、甚至只保留代码词元并打乱顺序,仍优于等长乱码;在固定候选库内按参考策略似然重选,低似然选择对每个来源都优于高似然选择。 这些干预把理论中的转移质量、任务结构与参考耦合三个量转化为可操作的构造规则,并显示增益部分来自任务结构本身而非与具体提示绑定的错误。 混合实验中14B学生的Llama-1B份额上升时avg@4从59.730升至63.280,Qwen2.5-3B份额上升时从59.575升至62.630;重分配与词元置换在每个学生规模上都超过等长乱码;重选实验在20,136条共享提示上比较Repelled、Native、Attracted三种选择,1.5B来源的Repelled达到63.135而Attracted为61.880。

研究识别出有效拒答的两个可观测性质:保留任务相关结构,同时限制与DPO参考策略的耦合;更小的冻结模型同时具备这两点且生成成本更低。 自然来源分析显示参考似然越高、下游avg@4越低,更小Base来源系统性地处于低耦合高效用一侧,而两种Self构造处于高耦合低效用一侧;重选实验进一步表明参考耦合可作为拒答分布的可操作属性而非仅是模型规模的代理。 成本代理显示更小Base来源的总成本约为同规模vanilla Self的0.9%至50.1%,对应49.9%至99.1%的削减,H100实测运行时间方向一致;优化诊断如拒答场、奖励边际、似然轨迹与RC-DPO未能复现更小Base优于Self的排序。

启示与展望

该结果面向采用SeqKD加DPO两阶段偏好蒸馏、且拥有可执行或可验证答案的任务场景,例如代码生成与数学推理;对这类场景,实践者可先用更小冻结Base模型生成拒答,再按参考似然做低似然筛选,并按更小Base份额做混合。跨模型族的Llama来源在九个代码配置中全部优于Self、九个MATH-500配置中八个优于Self,提示该做法不限于学生自身模型族。理论部分为线性化特征模型下的有限时域界,适用于特征有界、步长足够小的分析设定。

拒答效用为何在打乱词元顺序后仍保留,文中归因于代码域词法结构,但这一结构的具体内容仍是开放问题。参考似然与下游效用的负相关在自然来源上成立,重选实验也支持其可操作性,但两者之间的因果链条依赖线性化模型的近似。优化诊断未能复现来源排序,说明现有诊断量尚不足以在训练前预测拒答来源优劣。此外,本文为全文阅读,但部分表格数值在证据包中缺失,若需精确复现具体端点仍需查阅原文附录。

来源