跳到主要内容
返回时间线
arXiv来源发表:

把文本嵌入从T5-small换到T5Gemma-2并蒸馏其解码概率后,连续扩散语言模型的生成困惑度降到17.8,优于GPT-2-M

核心概要

该工作固定ELF连续扩散语言模型框架、只更换文本嵌入空间,发现沿T5-small→T5Gemma-1→T5Gemma-2扩大嵌入模型规模可提升可扩散性(同熵下生成困惑度约降40%),但原始T5Gemma-2嵌入过于判别性、采样不完美时会落到无效嵌入,于是用教师解码器概率作软标签蒸馏出学生编码器,使候选词嵌入更靠近;在OpenWebText上中等规模模型达到Gen. PPL 17.8(真实文本15.4)并超过GPT-2-M。

AI-generated editorial illustration: Scaling and Distilling Text Embeddings for Better Diffusibility

深度剖析

在固定ELF扩散框架、只替换嵌入模型的控制实验中,嵌入模型预训练规模越大,扩散生成质量越好:T5Gemma-1-B优于T5-small,T5Gemma-2又优于T5Gemma-1-B,且T5Gemma-2是唯一达到真实文本熵的嵌入空间,同熵下把生成困惑度相对T5-small降低约40%。 此前连续扩散语言模型多沿用较老的嵌入模型,或把嵌入与扩散模型联合训练,难以单独判断嵌入空间的贡献;这里把扩散侧固定为ELF,只改变嵌入,从而把嵌入空间的作用单独分离出来。 在OpenWebText 25%子集、512 token序列上训练同一个ELF-B,比较T5-small、T5-base、T5Gemma-1-S/B、T5Gemma-2-270M与ModernBERT,以生成困惑度—熵曲线呈现;作者说明不同编码器预训练数据量不同,因此受控比较是T5Gemma-2与蒸馏学生。

原始T5Gemma-2嵌入存在“难以被完美生成”的失效模式:生成嵌入可能远离所有候选词,被判定为无效或不确定;平均每条生成序列存在不确定位置,其中一部分为无效嵌入,且这些位置解码置信度低或解码成错误词。 以往工作把这类现象归为插值效应或模式平均,这里从“可扩散性”角度把它定义为生成有效、可解码嵌入的能力,并用候选词距离与解码top-1概率给出可量化的判据。 以部署解码头的top-k候选为参照,用真实嵌入的中位最近邻距离与真实文本top-1概率分布设定阈值,统计生成序列中的不确定与无效位置,并用二维可视化展示单条生成序列;作者指出阈值只要落在教师距离的双峰之间即可,具体取值不关键。

用T5Gemma-2解码器的概率作为软标签蒸馏出的学生编码器比教师更可扩散:学生把同一位置的可替代候选词嵌入拉近,生成嵌入更接近候选、往返去噪后更接近原句,且在相同ELF-B/ELF-M下生成困惑度与MAUVE均优于教师。 与直接复制教师嵌入(MSE)或用one-hot硬标签交叉熵训练相比,只有软标签蒸馏的学生能超过教师并达到真实文本熵;学生用教师均匀间隔层初始化,与教师同深度时仍优于教师,说明增益不来自容量缩减。 在完整OWT上蒸馏,学生编码器用KL拟合教师top-k重归一化分布;在OWT-1024与LM1B上以3个随机种子、每点多样本报告均值与标准差,并给出往返去噪与嵌入距离的对照分析。

在OpenWebText-1024上,蒸馏嵌入使ELF-M达到Gen. PPL 17.8(真实文本15.4)与熵5.45,优于GPT-2-M的20.8,也优于原始T5Gemma-2的19.3;在LM1B上学生同样优于原始T5Gemma-2(50.5对60.6)。 这给出一个以嵌入空间为切入点的连续扩散语言模型强基线,并显示连续扩散可与离散扩散、自回归基线在同一评测口径下比较。 所有生成与真实文本样本统一用GPT-2-Large分词器重新分词后计算生成困惑度与一元熵,MAUVE用GPT-2-Large特征;采样网格扫描自条件尺度与NFE,选取达到真实文本熵前提下生成困惑度最低的点,再以3个种子评估。

启示与展望

该结果面向使用连续扩散语言模型的研究与工程场景:在固定ELF框架、冻结嵌入模型、以OpenWebText与LM1B为主要评测语料、嵌入模型规模控制在较小范围内的设定下,说明选择更强且经软标签蒸馏的嵌入空间可以提升生成质量与采样稳定性。它可直接用于为连续扩散语言模型挑选或改造潜空间,也为把自回归基础模型适配成扩散用嵌入提供了一条可复制的蒸馏路径;蒸馏学生把编码成本相对T5Gemma-2减半,且嵌入在训练中冻结、可缓存,采样侧只影响最后一步解码,因此该路线在效率上具备扩展空间。

作者自己列出仍待回答的问题:少步与单步生成(原始T5Gemma-2在低NFE下欠积分甚至崩溃)、面向问答等真实任务的实用规模模型,以及如何跳过从自回归模型适配出嵌入模型这一步。此外,不同编码器预训练数据量不同,跨编码器的行并非完全受控,作者也提示只有T5Gemma-2与蒸馏学生构成受控比较;蒸馏以牺牲部分判别能力为代价(SST-2等下游分类下降),嵌入几何的更细粒度分析被留作未来工作;评测语料为OpenWebText与LM1B,LM1B被作者视为有问题的语料,仅作检查而非比较。

来源