跳到主要内容
返回时间线
arXiv来源发表:

MIRROR用参考揭示的在线自蒸馏把LLM个性化从模仿转向偏好内化,在三个基准上取得领先并减少遗忘

核心概要

MIRROR把用户参考文本当作事后信息,用同一模型在参考可见与可部署两种上下文下对自身在线生成轨迹做分布对齐,从而内化偏好而非复制措辞;MIRROR-F再对信息性且上下文可溯的参考词施加选择性锚定。在三个个性化生成基准、两种模型规模与参考及LLM评判下,两者取得领先的个性化与文本质量,并在三个未见任务上比SFT基线遗忘更少。

Source-provided article image: MIRROR: From Imitation to Internalization in LLM Personalization
Figure 1 ·

Figure 1: Overview of personalization paradigms. (a) A case study of the quality defects of existing methods. (b) Retrieval-based personalization. (c) SFT-based personalization. (d) MIRROR, which aligns a self-student with a self-teacher on the student’s own on-policy trajectories.

arXiv

深度剖析

MIRROR把个性化生成重新表述为参考揭示的自蒸馏:同一模型既作自教师又作自学生,教师在参考可见上下文中给出偏好感知的下一词分布,学生在自己采样出的在线前缀上对齐该分布。 与把参考响应逐词作为监督目标的SFT式微调不同,这里的目标是分布而非单个参考词,且评估前缀来自模型自身生成,因此训练与推理处于同一状态分布。 论文给出停止梯度的代理目标,并说明采样前缀与教师分布均被detach,梯度只经学生分布回传;作者称这使模型学到可迁移到无参考查询的偏好推理行为。

MIRROR-F在分布对齐之外增加选择性锚定损失,只对同时满足信息性表面形式且在学生上下文中以完整词出现的参考词施加监督,并以单一focality系数控制强度。 相对统一监督整个参考序列的做法,该机制把额外监督集中在术语、命名实体和数量等内容承载位置,同时保留由分布项承载的个性化风格。 选择规则为确定性表面形式启发式加词级上下文可溯检查,选中词扩展到全部子词位置;当选中集合为空时目标退化为MIRROR,作者报告focality系数在0.1至0.9间个性化指标保持稳定。

在LaMP与LongLaMP的三个个性化生成任务、Qwen3-1.7B与Qwen3-4B两种规模上,MIRROR与MIRROR-F在ROUGE-1、METEOR、BERTScore以及LLM评判的内容与风格得分上总体领先或保持竞争力。 相对检索式基线RAG、LatestK、LLM-TRSR与PEFT式基线SFT、OPPU、PerCE、NextQuill,作者报告MIRROR-F在多数设置取得最佳结果,包括Qwen3-1.7B下全部三个任务的ROUGE-1与METEOR。 每个参考式与LLM评判评估均以三个不同随机种子独立训练并取算术平均,评判模型为Qwen3-30B-A3B且解码温度固定为零,每任务评估100个共同样本。

在三个未参与训练的OOD个性化生成任务上,MIRROR与MIRROR-F的性能下降小于SFT式方法,并在G-Eval的连贯性、一致性、流畅性与相关性四个维度上高于SFT、PerCE与NextQuill。 作者把SFT式方法在未见任务上的明显退化归因于对参考特定词级监督的强依赖,而在线分布对齐把偏好相关行为而非参考措辞迁移进模型。 OOD结论基于Amazon Reviews与Music Review等未训练任务的相似度指标退化幅度比较,文本质量结论基于参考无关的G-Eval与SummEval维度评分。

启示与展望

该工作面向拥有用户历史与用户撰写参考文本的个性化文本生成场景,训练期教师可访问参考,部署期学生只使用用户历史与当前问题,因此结果适用于参考可得且任务形式与LaMP、LongLaMP相近的设定。方法以LoRA在Qwen3-1.7B与Qwen3-4B上训练,1.7B为200步、4B为250步,主实验focality系数固定为0.5,这些配置界定了当前结论的适用范围。对希望减少灾难性遗忘、同时保持内容专业性的团队,该框架提供了可复用的训练目标接口:分布对齐项承载风格,选择性锚定项承载内容,锚定规则可按领域替换而不改动蒸馏机制。

混合系数被固定为0.5,作者明确表示不主张其最优,替代取值的系统研究超出本文范围;focality系数在0.1至0.9间个性化指标稳定,但锚定强度与专业质量呈非单调关系,中等取值表现最好。规则式信息完整性指标只衡量预定义可溯信息词的精确覆盖,不捕捉改写、事实蕴含、流畅性或风格,需与G-Eval结果联合解读。Qwen3-4B新闻任务上MIRROR的信息完整性高于MIRROR-F,说明锚定的收益依任务与骨干而异。思考模式消融显示其效果随任务与规模变化,个性化与长程推理是否可联合提升仍是开放问题。

来源