跳到主要内容
返回时间线
arXiv来源发表:

LT-OPD 用自身生成轨迹上的在线自蒸馏,把 5% 视觉 token 下的平均保留性能从 68.6% 提到 82.3%

核心概要

该工作提出 LT-OPD,让只保留 5% 视觉 token 的学生模型在自己的生成轨迹上接受冻结全 token 自身教师的分布监督,并配合逐步降低 token 预算的课程,在 Qwen3.5-4B 九个基准上把平均保留性能从 68.6% 提升到 82.3%,同时把 KV 缓存降低 85.2%、prefill FLOPs 降低 85.4%,且不增加推理开销。

AI-generated editorial illustration: Fewer Tokens, More Self-Teaching: On-Policy Self-Distillation for Extreme Visual Token Reduction

深度剖析

作者把极端视觉 token 压缩重新表述为一个训练问题:低预算不仅减少视觉证据,还改变了压缩模型在推理时遇到的生成状态,因此固定前缀上的训练无法覆盖学生自己预测出的状态。 此前工作主要分为免训练的选择式压缩(FastV、DivPrune、DART、CDPruner、HiPrune、ZOO-Prune)与固定前缀的训练式适配(MQT-LLaVA、LLaVA-Mini、EPIC、LearnPruner),论文用一张对比表把“前缀/状态来源”和“是否在线”作为区分维度,指出这些方法都不在自身生成状态上学习。 论文以图示说明低预算下压缩模型预测分布与全 token 对应模型的偏离,并以此作为方法动机;该观察属于作者自述的实证动机,未给出独立的量化偏离度量。

LT-OPD 让学生用少量视觉 token 自行 rollout,冻结的全 token 同源模型在同一学生生成前缀上给出下一 token 分布监督,用 Jensen-Shannon 散度作为目标,采样轨迹做 stop-gradient 处理。 与 EPIC 等渐进一致性蒸馏、以及以更强或信息更多教师为目标的既有在线蒸馏不同,这里的教师是同一模型的冻结全 token 副本,监督位置由压缩学生自己决定。 方法在正文中给出问题形式化、rollout 采样、教师与学生分布定义以及 JSD 目标;实现细节(top-100 词表支撑加一个聚合尾部类别、混合系数 0.5、损失按序列内有效 token 平均再跨序列平均)列在附录 B。

预算级课程把保留率从较高起点按余弦曲线降到 5%,消融显示去掉最后在 5% 上的保持阶段后平均保留率从 82.3% 降到 79.5%,而仅用固定前缀 JSD 的知识蒸馏为 77.6%。 论文把课程与在线性分开消融:课程在纯 SFT 上带来 2.7 个百分点提升,仅在线蒸馏(无课程)达到 81.5%,说明两个组件各自有贡献。 消融在同一训练配置、同一初始化种子与 175 次更新预算下进行,并在 5% 保留率下按统一评测协议评估。

在 Qwen3.5-4B 的九个基准上,5% 视觉 token 下平均保留率由 68.6% 升至 82.3%,高于最强免训练基线 DivPrune 的 77.6% 与训练式基线 EPIC 的 73.7%,并在 9 个基准中的 8 个取得同预算最佳。 论文强调 5% 预算下的结果超过所有保留 10% token 的免训练方法(最高 80.2%),并接近 15% 或 20% 预算的最佳结果,说明适配训练可以部分替代更多 token。 结果来自九个基准的完整表格,覆盖感知密集(V*Bench、HR-Bench 4K)、通用 VQA(GQA、MMMU、MMB、MME)、幻觉(POPE)与 OCR(TextVQA、OCRBench)四类;同时给出与 GRPO、GSPO、DAPO 三种强化学习算法的对比,LT-OPD 的 82.3% 高于三者的 75.8%–78.2%。

启示与展望

该结果面向需要在极端视觉 token 预算下运行多模态大模型的部署场景,例如边缘设备或资源受限推理;论文给出的适用条件是保留 5% 视觉 token、使用 CDPruner 作为选择器、并在 LT-14K(14,000 条单图问题)上训练。方法层面,它适用于任何可提供冻结全 token 自身副本作为教师的 MLLM,论文在 Qwen3.5-4B/9B、GLM-4.6V-9B 与 LLaVA-OV-1.5-4B 上验证了这一点。效率上,收益集中在 prefill 侧:KV 缓存与 prefill FLOPs 各降约 85%,端到端延迟仅从 1331.5 ms 小幅降到 1293.7 ms,因为自回归解码时间由逐 token 计算与内存访问主导。训练成本为 8 张 A100 80GB 上 15.1 小时、175 次更新、112,000 条生成轨迹。

论文正文与附录给出了大量表格,但部分内容(如不同训练目标的完整解释、多图基准的细节、定性案例)分布在附录中,若只读摘要或正文,难以完整判断各组件贡献的相对大小。教师始终是冻结的初始全 token 策略,论文也测试了信任域正则与 EMA 教师两种变体,平均保留率在 81.3%–82.3% 之间,说明结果对教师构造不敏感,但这也意味着教师随训练演化的潜在收益尚未被充分探索。目标函数消融显示 JSD 在感知密集基准上更好,而前向与反向 KL 在 OCR 基准上更高,说明最优目标可能依赖任务类型。多图与视频基准上的结果被作者列为未来方向,视频理解场景下的表现仍需更多验证。此外,效率测量基于 305 条 TextVQA 问题的固定参考重放,实际部署中的延迟表现可能随负载与硬件不同而变化。

来源