把生成模型建模为有向加权图后,跨模型合成数据流被证明会同时决定自消耗训练系统的收敛阈值与多样性收缩程度
核心概要
该工作把多个互相消费合成数据的生成模型建模为有向加权图上的节点,用重训练动力学的雅可比与比较矩阵推导出局部渐近稳定的充分条件,并给出固定点处系统多样性的上界,表明稳定性由局部放大因子与图传播共同决定,而合成数据消费会产生依赖拓扑的平滑效应、压缩模型间差异;在8模态高斯数据与CIFAR-10上,多种生成模型与多种交互拓扑的实验趋势与理论预测一致。
Figure 1 : From networked self-consuming models to graph abstraction. (1) Left: A generative ecosystem in which each model is trained on its own real-data distribution and a weighted mixture of synthetic data produced by other models. (2) Right: Abstraction of the system as a directed, weighted interaction graph that captures effective synthetic-data propagation among models. (3) Top right: An example local retraining rule, where Model 3 3 is trained at iteration t t on p 3 data + λ 3 ∑ j = 1 K w 3 j p 𝜽 j t − 1 p^{\mathrm{data}}_{3}+\lambda_{3}\sum_{j=1}^{K}w_{3j}p_{\boldsymbol{\theta}_{j}^{t-1}} .
arXiv深度剖析
论文提出一个统一框架,把网络化自消耗生成模型表示为有向加权图:节点是模型,边权是某模型生成的合成样本被另一模型消费的概率,邻接矩阵行随机且允许自环,每个模型每轮在真实数据与自身及父节点合成数据的混合上更新参数。 此前关于自消耗训练的分析大多局限于单个孤立模型,或局限于两个模型之间高度简化的交互;该框架允许任意有向加权图与异构模型、异构真实数据分布,并把单模型情形作为特例包含在内。 框架以形式化定义给出(问题表述一节),并说明当只有一个模型且只消费自身数据时退化为已有单模型自消耗动力学;论文同时给出一个两模型异构例子,说明耦合动力学的固定点可以不同于各自独立训练的解。
论文给出网络化重训练动力学的局部稳定性判据:在固定点附近用雅可比分析,若比较矩阵的谱半径小于1,则固定点局部渐近稳定,迭代以线性速率收敛;该判据把局部放大因子(由合成数据混合权重与局部曲率决定)与图传播效应分开。 该条件严格推广了此前单模型分析的稳定性阈值,可容纳任意有向加权图;同时给出一个基于范数的充分条件,其阈值同时依赖跨模型敏感度与交互图的谱范数。 结论以定理与推论形式给出并附证明;论文指出基于范数的条件使用图的全局最坏情形刻画,因而可能偏保守,不同图可能共享同一范数值却表现出不同动力学。
论文用有向环的环增益刻画图拓扑对稳定性的影响:谱半径不小于任一简单有向环的环增益,因此网络主要由几何平均增益最大的主导环决定,环长只通过几何平均起作用;若系统稳定,则每个简单有向环的环增益必须小于1,自环也必须小于1。 这把稳定性从全局范数标量推进到可定位的结构特征,说明单个主导环可以成为整个系统的瓶颈,而不取决于环的总数或长度。 结论以命题与推论形式给出并附证明;在可控闭式系统中,论文报告四个系统具有相同的交互范数,但精确收敛因子从0.582到0.900不等,且经验收敛速率与谱半径在小数点后三位一致。
论文给出固定点处系统输出多样性的上界:固定点表示是真实数据质心经线性平滑算子作用的结果,该算子把初始数据多样性映射为最终输出多样性,形成坍缩系数;无跨模型交互时多样性得以保留,合成数据混合越强则平均效应越强,图拓扑决定哪些分歧被削减,而表示误差项带来与拓扑无关的多样性。 此前工作多关注单模型或双模型的坍缩现象,该结果把多样性收缩与交互图结构显式联系起来;在对称交互的特例下,多样性上界由代数连通度刻画,连通度越高坍缩越强。 结论以定理与推论形式给出并附证明;在CIFAR-10上让模型使用不相交或部分重叠的数据子集,观察到合成混合比例升高与更稠密的交互图都降低多样性,且交互强度更大的系统多样性下降更快。
启示与展望
该框架面向的是把多个生成模型视为图节点、以行随机矩阵描述合成数据流向的重训练系统,适用于分析固定点附近的局部稳定性与均衡处的多样性,而非给出全局存在性与唯一性保证。它可直接用于比较不同交互拓扑与合成混合强度下的长期行为,例如识别主导反馈环、评估连通度对同质化的影响,并为控制高增益环或向高放大节点分配真实数据等缓解思路提供依据。适用对象是希望理解多模型合成数据生态长期风险的研究者与平台运营方,前提是系统确实在某个固定点附近演化。
分析建立在固定点附近的标准局部正则性假设之上,而实际深度生成模型涉及有限样本、随机优化与非凸目标,理论结论与大规模训练之间仍有距离。多样性结果给出的是上界,更精细的刻画、以及如何把有意义的专门化与不稳定性导致的多样性区分开,仍是开放问题;论文也指出当固定点一般未知时,多样性上升可能来自不稳定性而难以量化。此外,实验验证的是定性趋势,交互图与混合比例的具体取值对结论的影响仍需在更多拓扑与更大规模设置下考察。
