跳到主要内容
返回时间线
arXiv来源发表:

CARD 用聚类 LoRA 加解码期偏好向量,在 LaMP 与 LongLaMP 六项任务中 12 个指标拿下 10 项第一

核心概要

CARD 提出一种分层个性化文本生成框架:先按写作风格把用户聚类并为每个簇训练共享 LoRA 适配器,再用对比用户文本与簇级生成结果的隐式偏好学习得到轻量用户偏好向量,推理时仅通过低秩 logit 修正进行解码期个性化,在 LaMP 与 LongLaMP 六个任务、两个指标共 12 个设置中排名第一的有 10 个,并在低资源用户、跨模型规模与存储效率上表现稳定。

AI-generated editorial illustration: CARD: Cluster-level Adaptation with Reward-guided Decoding for Personalized Text Generation

深度剖析

CARD 把个性化拆成“簇级共享先验 + 用户级轻量向量”两层,簇级 LoRA 负责泛化与低资源兜底,用户偏好向量负责细粒度风格差异。 此前 PEFT 类方法多为每用户一套参数,随用户规模增长存储与训练成本高;RAG 类方法把用户历史塞进提示,个性化较浅且受检索质量影响。CARD 用簇级适配摊薄成本,把个体差异推到解码期。 论文在 LaMP 与 LongLaMP 六个任务、ROUGE-1 与 ROUGE-L 两个指标共 12 个设置中,CARD 有 10 个排名第一,另两个接近最优(LaMP5 R-1 为 0.459 对 0.464,LongLaMP2 R-1 为 0.252 对 0.255);消融显示去掉用户向量后 LaMP-4 的 R-1 从 0.218 降到 0.148。

隐式偏好学习用“用户真实文本 vs 簇级 LoRA 生成文本”构造偏好对,让同一语义下的风格差异成为监督信号,无需人工标注。 论文指出显式偏好标注成本过高,而用随机负例的启发式构造会把话题内容与风格纠缠在一起;CARD 的负例来自同簇 LoRA 在同一提示下的生成,语义对齐而风格不同,从而隔离出纯风格偏差。 偏好对构造方式在方法部分给出,训练使用 Bradley–Terry 成对损失,簇级 LoRA 与主干保持冻结;论文称该设计缓解了偏好数据稀缺,并在低资源用户上仍有效。

推理期个性化只改 logit:用户偏好向量对隐状态做通道级调制,再经低秩词表映射修正簇级 LoRA 的 logits,且只作用于 Top-k 候选 token。 与需要每用户微调或长上下文检索的方案相比,CARD 让主干与簇参数在推理时保持冻结,用户切换只需更换紧凑偏好向量,论文称其可存于用户设备用于端上个性化。 论文给出 Top-k 限制把复杂度从全词表降到候选集,并报告新用户只需一次轻量、免训练的画像编码用于分簇;效率对比表列出训练时间、单查询延迟与单用户存储三项指标。

评测同时使用自动指标、GPT-5.2 作为 LLM 评委与人工评估,三者总体一致但并非完全吻合。 论文报告 LLM 与人工评分在排序上大体一致,但在高度风格化任务上分歧更大;CARD 在 LaMP-4、LaMP-5、LaMP-7 上相对非个性化基线的 LLM 评分提升分别为 76.4%、95.5%、113.5%,人工评估增益同样显著。 附录给出 Pearson 平均 0.687、Spearman 平均 0.670、Kendall 平均 0.529、标准 Cohen's Kappa 平均 0.384、加权 QWK 平均 0.618;论文解释标准 Kappa 偏低是因为它对 5 分制上的 1 分偏差惩罚过重。

启示与展望

这项工作面向有个性化写作历史可供建模的文本生成任务,例如新闻标题、学术标题、推文改写、摘要生成、话题写作与商品评论;论文在 LaMP 与 LongLaMP 上验证,主干为 Qwen3-8B,并额外扫描 0.6B 至 32B 的 Qwen3 规模。对希望在不做每用户微调、不把长历史放进上下文的前提下部署个性化的团队,CARD 提供了一条“簇级适配 + 解码期向量”的路径,新用户只需一次免训练的画像编码即可分簇并估计偏好向量。论文还指出用户偏好向量可存于用户设备用于端上推理,服务方只发布轻量个性化模块,从而减少原始历史数据暴露。

论文自述的边界包括:离线分簇使用无监督 K-means,可能无法完整刻画复杂的用户关系或潜在个性化结构;每个用户在解码期只用一个偏好向量,对多样或演化的偏好表达力有限,且学到的维度不直接可解释;多阶段流程仍需多个组件协同;噪声或弱相关的历史会削弱学到的用户向量。论文还提到长历史下 LaMP-7 性能下降,可能反映噪声历史的影响,并把历史过滤、相关性加权与噪声鲁棒的画像选择留作未来工作。此外,实验使用验证集作为测试集,因为官方测试集未公开,这一点会影响结果与公开榜单的直接可比性。读者若关心具体任务上的绝对水平,需要回到正文表格与附录核对每个任务的数据规模与截断设置。

来源