跳到主要内容
返回时间线
arXiv来源发表:

D-OPCD 把智能体提示经验蒸馏进扩散模型权重,直接生成均分从 60.52 升至 65.09

核心概要

作者提出扩散在线策略上下文蒸馏(D-OPCD),把智能体框架生成的提示当作教师独享的特权上下文,在学生的去噪轨迹上监督只接收原始查询的学生模型,从而把提示层面的框架收益写入扩散模型权重;配合自动技能演化器(ASE),四个基准上的直接生成均分从 60.52 提升到 65.09,且更新后的生成器在无技能框架下平均略高于原技能框架智能体。

Source-provided article image: Internalizing Agent Experience into Diffusion Model Weights via On-Policy Context Distillation
Figure 1 ·

Figure 1: Method overview. As tasks accumulate, a T2I harness learns reusable skills that improve its prompts while the generator remains fixed. D-OPCD conditions an EMA teacher on the original query q i q_{i} and the harness-selected prompt p i p_{i} , and trains a student conditioned only on q i q_{i} to match the teacher’s predictions along the student’s own denoising trajectory. The updated generator can generate from q i q_{i} alone, while the harness resets its skills to continue adapting around it.

arXiv

深度剖析

D-OPCD 将框架产生的提示作为特权上下文,用同时接收原始查询与框架提示的教师,去监督只接收原始查询的学生,并在学生自身去噪轨迹的状态上比较两者预测的速度场。 此前的在线策略扩散自蒸馏从目标图像或参考图像获取特权信息,而这里把特权信息换成演化框架所构造的提示,使提示层面的框架收益可以进入生成器权重。 论文给出非对称条件、在线 rollout 与目标函数的形式化定义,并在四个基准上与 Vanilla SFT、Diffusion-DPO、D-OPSD 在相同记录、相同 Z-Image-Turbo 权重和相同 LoRA 优化预算下比较,D-OPCD 均分 65.09 为最高。

ASE 把任务执行轨迹逐级整理为 episode、insight 与 skill,成熟 insight 经技能管理器提交为技能库版本,每个提交版本构成一个新的框架版本。 框架经验不再只是推理时的外部提示,而是被组织成可版本化、可回放、可被蒸馏的数据来源,为框架与生成器之间的接口提供了具体实现。 论文描述了六种 insight 操作与九种技能操作、成熟度阈值、容量与长度约束,以及按基准变化的触发与评审间隔设置,并报告了每轮演化中被选中的技能更新快照与贡献经验的任务数。

把框架收益内化后,生成器在无框架直接生成时四个基准全部优于基座,均分由 60.52 升至 65.09;接回无技能框架后均分 82.33,略高于原技能框架智能体的 81.83。 这说明部分技能收益可以留在权重中,而不必在每次请求时重新检索和应用外部指导。 结果来自四个基准的官方评测指标,训练与评测任务集按演化、选择、报告三部分互斥划分,且内化差距在 R2I-Bench 上同样为正。

清空已内化的技能后重新运行 ASE,新一轮技能在三个基准上继续提升,均分达到 84.16,高于更新后的无技能框架与原技能框架智能体。 这给出一个可迭代的框架—模型共同演化循环:生成器吸收旧技能后,框架可以丢弃饱和技能并围绕更新后的生成器继续演化。 论文报告了一轮后续技能演化在四个基准上的结果,并指出 R2I-Bench 在技能演化后反而下降,作者将其归因于无技能框架下该基准得分已较高、可提升空间较小。

启示与展望

该结果面向以提示构造、验证与迭代精修为主要增益渠道的文生图智能体,适用于框架与生成器分离、且框架经验可以归结为查询—提示对的设定。对使用者而言,这意味着可以把一部分反复检索与应用的框架指导一次性写入生成器权重,从而在推理时只给原始查询;论文也展示了在权重吸收旧技能后清空技能库、让 ASE 围绕更新后生成器重新演化的流程。作者指出,扩展到会搜索网页、检索参考图像或使用其他工具的图像生成智能体,需要先判断哪些可复用能力适合转入权重、哪些信息应留在推理时的工具中。

内化到权重中的收益幅度有限:直接生成均分 65.09 仍明显低于原技能框架智能体的 81.83,作者提出一种可能解释是演化技能产生的提示虽在框架使用时有效,却可能与扩散模型从原始查询学习同一行为的潜空间对齐不佳。论文只评估了一个基座生成器、一次 D-OPCD 更新和随后一轮技能演化,因此多轮更新—重置循环下的收益保持、向新任务的迁移,以及离线训练成本与反复框架推理成本之间的权衡仍是开放问题。此外,改进过滤与多样性适配两种上下文设计对下游均分的影响并不一致,哪些框架产生的上下文最适合被模型内化尚无定论;R2I-Bench 在技能演化后下降,也提示不同基准的可提升空间存在差异。

来源