用Fisher-Rao几何重新界定防止模型坍塌所需的人类数据比例
核心概要
该工作把生成模型的迭代训练建模为概率单纯形上的闭环随机过程,改用Fisher-Rao度量而非欧氏度量分析其动力学,推导出随维度增大仍不失效的收缩与不变性界,并给出保证收敛到Fisher-Rao球的人类与合成数据比例阈值,结论是有效所需的人类数据比例高于此前欧氏分析所暗示的水平。
深度剖析
在Fisher-Rao度量下给出了迭代训练动力学的定量收缩与不变性界,并给出人类与合成数据比例μ的显式阈值条件。 此前工作[15]在欧氏度量下给出收敛到欧氏球的界;本文改为在概率单纯形的信息几何结构上直接分析,得到式(8)的Fisher-Rao球收敛界与式(9)的球半径ϵ_FR,以及式(7)的μ阈值。 结果为定理形式的严格理论推导,依赖Assumption 1(扰动有界‖ε(t)‖∞≤η、人类分布各分量严格正δ>0)与Assumption 2(存在平衡点θ_e),并通过Lemma 1至Lemma 8逐步证明,属于数学证明而非实验验证。
欧氏度量下的界在高维下会变得空洞,而Fisher-Rao界不会随维度增大而失去意义。 论文指出当n→∞时几乎任意两个概率分布的欧氏距离趋于零,并给出“不相交”概率向量p、q的例子:其欧氏距离按O(1/√n)衰减,而Fisher-Rao距离恒为π/2。 该对比由文中给出的具体构造与距离计算支撑,属于概念性反例论证,用于说明为何需要更换度量。
在给定标度律下,两种度量的误差界随维度n的衰减速率不同,Fisher-Rao分析要求人类数据比例增长得更快。 Proposition 1在δ_n∼n^(−β0)、μ_n∼c n^p、p>2β0的条件下给出:欧氏情形ϵ=Θ(n^(−p)),Fisher-Rao情形ϵ_FR=Θ(n^(1/2+β0−p))。 该标度结论由Proposition 1的证明给出,包含对θ_e随n变化的界(如‖θ_e−θ_0‖∞=O(n^(−p))、min_i θ_e,i=Θ(n^(−β0)))的推导。
若希望获得例如O(1/n)量级的衰减,一个自然的人类数据比例选择是μ_n=n^(5/2+γ)(γ>0),而欧氏估计在μ_n∼n时就预测1/n量级误差。 论文据此指出欧氏估计未计入在n个坐标上分配概率质量的几何代价,μ_n∼n并不能阻止Fisher-Rao误差增长,因此需要更强的μ_n增长。 该论断是在无θ_e额外结构信息时给出的示例性选择,基于Proposition 1的标度关系,属于理论推论而非实验测量。
启示与展望
该结果适用于被建模为式(5)闭环随机过程的迭代训练场景,要求扰动有界、人类分布各分量严格为正且存在平衡点θ_e,并假设人类与合成数据比例μ=β_k/α_k为常数;在此设定下,它给出收敛到Fisher-Rao球的大小、收敛速率以及保证该行为的μ阈值,可用于指导混合真实与合成数据时的比例下限估计。
读者仍会关注:该连续时间极限与常数比例μ的假设在真实离散、分批训练流程中的贴合程度;阈值式(7)与球半径式(9)中δ、η、T、θ_e等量在实际模型中如何估计;以及当θ_e缺乏单纯形约束之外的结构信息时,μ_n=n^(5/2+γ)这类选择在具体任务中的可行性。本文为理论分析,未提供实验验证,因此这些量在实践中的取值与影响仍是开放问题。
