跳到主要内容
返回时间线
arXiv来源发表:

后训练的能力会通过无关文本泄漏:仅用教师每提示一个词,学生模型在 HumanEval+ 上提升 5.34 个百分点

核心概要

作者提出 Active Taskless Distillation(ATD),通过挑选教师模型与学生模型共同公开祖先模型在两个普通词之间几乎无偏好的提示,仅用教师给出的单个词作为监督信号,让从该祖先初始化的学生模型在没有任何目标任务样本、教师 logits 或教师参数的情况下学习;在 Qwen2.5-1.5B 的主要编码实验中,5,664 条样本使 HumanEval+ 相比严格匹配干扰因素的对照提升 5.34 个百分点,并在科学知识、常识推理和阅读理解等任务以及更多模型世代、规模和家族上显示迁移,功能分析显示所学信号可组合且强度随教师更新强度变化。

Source-provided article image: Post-Training Leaves Behavioral Shadows on Unrelated Decisions
Figure 1 ·

Figure 1 : Reading a post-training update through target-unrelated decisions with ATD . Using only the public base M 0 M_{0} , ATD samples ordinary prompts on which M 0 M_{0} is nearly indifferent between two words (near-ties), and asks the private teacher M T = M 0 + δ M_{T}\!=\!M_{0}\!+\!\delta for one word at each; where the update tips a near-tie, the returned word is a one-bit observation of the teacher’s behavioral shadow. A student initialized from the same M 0 M_{0} then learns only from these prompt–word pairs, and a matched control keeps the same words but breaks the pairing. Evaluated on held-out target tasks it never saw in training, the student trained on the true pairs outperforms the control, and different shadows lift different capabilities.

arXiv

深度剖析

语言模型可以通过与任务无关的文本传递能力,后训练留下的“行为影子”会出现在无关决策上。 此前关于潜意识学习的工作主要关注特质或偏好,且依赖大量教师输出;本文把这一现象扩展到能力迁移,并把监督压缩到每个提示仅一个词。 摘要报告了在 Qwen2.5-1.5B 上的主要编码实验,5,664 条样本带来 HumanEval+ 上 5.34 个百分点的提升,并设有严格匹配干扰因素的对照。

ATD 通过选择教师与学生的共同公开祖先模型在两个普通词之间几乎无偏好的提示,构造出仅含提示-词对的训练信号。 学生模型不需要目标任务示例、教师 logits 或教师参数,只从这些提示-词对中学习。 方法描述明确说明学生从共同祖先初始化,训练信号仅为提示-词对;主要实验给出了与匹配对照的量化比较。

这种迁移不限于编码任务,还出现在科学知识、常识推理和阅读理解上,并跨越更多模型世代、规模和家族。 把能力迁移的观察从单一模型和单一任务扩展到多类任务与多种模型配置。 摘要称在额外模型世代、规模和家族上进行了实验,但未在摘要中给出各任务的具体数值。

功能分析显示所学信号是可组合的,且其强度与教师的更新强度同步变化。 提供了关于该行为影子内部结构的初步刻画,而不仅是迁移是否发生。 摘要以“功能分析”概括,未列出具体指标或实验规模。

启示与展望

这项工作面向研究后训练如何影响模型行为的研究者与工程师,适用于从公开祖先模型初始化、并希望在不使用目标任务样本的情况下迁移能力的场景。它提示可以在编码、科学知识、常识推理和阅读理解等任务上,用极轻量的提示-词对信号探测教师更新留下的行为痕迹,并为跨模型世代、规模和家族的迁移研究提供起点。

摘要未给出科学知识、常识推理和阅读理解各任务的具体增益,也未说明功能分析中“可组合”和“强度随教师更新强度变化”的量化方式;5,664 条样本与 5.34 个百分点提升的对应关系、匹配对照的具体构造,以及跨模型世代、规模和家族的实验规模,都需要在正文中确认。此外,摘要文本存在若干处不完整表述,相关细节应以原文为准。

来源