跳到主要内容
返回时间线
arXiv来源发表:

腾讯团队提出自适应奖励路由,在LTX-2与LTX-2.3上十项指标中九项取得最优

核心概要

该工作提出自适应奖励路由(Adaptive Reward Routing),在DiffusionNFT前向过程强化学习中同时自适应调整奖励驱动更新的作用位置与多奖励协调方式:用双向交叉注意力响应作为跨模态影响的代理来动态重加权token损失并缩放跨模态层梯度,并在预热后以分支内奖励梯度交互作为残差修正预设偏好权重,在LTX-2(19B)与LTX-2.3(22B)两个联合音视频扩散骨干上、基于19,487条音视频提示训练,于JavisBench的10,140条提示上在十项指标中的九项取得最优。

AI-generated editorial illustration: Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL

深度剖析

论文把联合音视频扩散模型的强化学习后训练重新表述为两个耦合维度上的动态多奖励优化问题:奖励驱动的更新应当作用在哪里,以及多个奖励应当如何协调。 此前方法(如OmniNFT)基于基础模型固定层路由,GDPO以固定权重聚合各奖励,MARBLE按梯度几何调整权重但不编码偏好与模态责任;该工作将两个维度统一为可随训练演化的自适应过程。 论文通过探测基础模型与OmniNFT训练后检查点,展示跨模态功能与梯度流在微调中发生变化,从而说明静态路由会逐渐失效;这是问题动机层面的证据,而非最终性能证据。

跨模态影响引导路由以双向交叉注意力响应作为跨模态影响的代理,层聚合得到token权重、token聚合得到层尺度,在不增加模型干预的情况下定位更新位置。 相比固定路由,该方法在训练中重新计算token与层路由;层尺度以软分离系数缩放反向梯度,前向值保持不变,强影响层保留更多梯度、弱耦合层被更多分离。 在四个训练检查点上逐一禁用48个A2V或V2A块,代理与干预得到的层排序高度一致(A2V与V2A的Spearman相关接近1);从当前模型重算的代理在整个微调过程中保持较高相关,而初始化时冻结的代理下降到较低水平;屏蔽得分最高的10%目标token比屏蔽等量随机token对最终预测的改变更大。

偏好保持的模态感知重加权在负责各目标的分支内估计奖励冲突,预热后把冲突系数作为预设奖励权重的残差修正。 GDPO保留显式偏好但无法适应冲突,MARBLE适应局部梯度几何但不编码偏好或模态责任;该方法让先验设定非零下限,残差项适应当前冲突,避免主导奖励压制弱但必要的目标。 消融显示分支感知平衡、残差混合与预热各自带来改进,且路由链固定GDPO权重、加权链不继承路由,从而分离两条轴;完整模型在质量、语义一致性与同步性上取得最佳整体平衡。

在两个联合音视频扩散骨干上,该方法在JavisBench的十项指标中九项取得最优,并在训练动态上同时保持五项奖励的较优轨迹。 相比GDPO、MARBLE、OmniNFT与作者发布的OmniNFT*检查点,该方法在模态质量、语义一致性、跨模态一致性与同步性上一致提升,且趋势在两个骨干上相同。 LTX-2上VQ 3.336、AQ 5.868、AV-IB 0.235、AVHScore 0.234、JavisScore 0.206、DeSync 0.341;LTX-2.3上VQ 3.599、AQ 5.979、AV-IB 0.267、AVHScore 0.266、JavisScore 0.236、DeSync 0.302;GDPO、MARBLE、OmniNFT与本文方法各以三个随机种子在相同数据、LoRA与优化预算下独立训练并报告算术均值,基础模型与OmniNFT*为固定检查点。

启示与展望

该结果面向联合音视频扩散模型的多奖励后训练场景,适用于模态token可识别、方向性交互响应可分离的架构;论文在LTX-2(19B)与LTX-2.3(22B)两个双流骨干上验证,并称路由可扩展到统一单流JavisDiT++骨干,奖励协调部分与架构无关。训练使用19,487条来自VGGSound衍生语料的音视频提示,优化五个奖励信号,评估在JavisBench的10,140条提示上按四秒、24 FPS、16 kHz协议进行。对采用其他扩散目标的研究者,论文指出路由可通过其token损失与梯度路径扩展,奖励协调只需奖励级梯度。

论文自述尚无统一的奖励模型能同时刻画模态质量、语义一致性与时间同步,人类偏好模型提供互补的整体信号但不能替代细粒度的模态监督;对于模态表示不可分离或交互响应不可获取的模型,路由仍属未来工作。消融中单个组件可能偏向不同目标,中间配置未必在每项指标上单调改善,因此整体平衡的结论依赖完整配置。此外,本证据包为全文文本,未包含图表本身,图3的定性示例、图4的训练动态曲线与图5的代理验证曲线只能依据正文描述理解。

来源