清华团队用GFlowNet把SIS提议分布变成学习问题:一个网络在1190个未见边际上零样本匹配或超越31种解析提议的事后最优
核心概要
该工作证明固定边际二值矩阵的零方差序贯重要性采样(SIS)提议分布恰好是单位奖励GFlowNet的策略,并提出MarginFlow——一个读取剩余边际的集合Transformer,在1904个边际上训练后,于1190个留出边际上零样本运行,在1187个边际上匹配或超越31种解析设计配置的事后最优,中位有效样本比例为99.8%。
深度剖析
论文建立了零方差SIS提议分布与单位奖励GFlowNet前向策略之间的等价关系:在给定边际的所有二值矩阵上奖励为1时,任一状态处的流等于其完成数,初始状态处的流等于矩阵总数,按流比例选择子节点即得到理想提议分布。 此前SIS提议分布均由解析式预先设计,其精度随边际变化而显著波动;该工作把提议分布构造从解析设计转为学习问题,并指出训练无需知道计数本身。 该等价关系以引理3.1和定理3.2给出并附证明;定理3.2进一步表明任意提议分布的轨迹平衡残差等于其对数权重(相差常数),且当且仅当权重恒定时损失为零。
MarginFlow利用问题的自相似性实现跨边际摊销:每个部分矩阵本身就是一个缩减边际的实例,因此一个读取剩余边际的集合Transformer可同时服务于所有边际,无需逐实例训练、调参或选择。 以往学习型提议分布多为每个模型训练一个网络,或按实例条件化;这里通过行逐行构造与剩余边际的对称性(命题3.6),让一个网络在池中所有边际的所有状态上获得梯度。 网络为四层宽度256的集合Transformer(约3.3M参数),无位置编码以在构造上保持对称性;训练池含1904个边际(1688合成、216真实),三个随机种子各训练约25小时(8张A100)。
在1190个留出边际(合成与真实,规模从3×3到870×6)上,MarginFlow在1187个边际上匹配或超越31种解析配置的事后最优,中位有效样本比例为99.8%;在事后最优损失超过1 nat的56个边际上全部取胜,中位有效样本比例从10.3%提升到94.1%。 解析提议分布在困难边际上会失效,且事后最优需要预先知道每个边际该选哪种配置,是用户无法做出的选择;学习型提议分布在这些边际上保持有效。 基线为31种配置(5种提议×6个指数加均匀分布),事后最优在8次重复上选出、16次重复上报告;681个边际用动态规划精确计算有效样本比例,其余509个从抽样估计并取16次重复的中位数。
误差按行累积:矩阵权重是各行权重的乘积,每行固定误差在长表上线性复合,因此解析提议分布在行数多时损失急剧上升,而MarginFlow每行误差更小。 这解释了为何解析设计在长表上失效、而学习型提议分布仍能保持,并给出可验证的机制而非仅报告总体指标。 定理C.1与推论C.2给出每行误差上界;图4显示Harrison–Miller提议在6行时有效样本比例98.7%、840行时降至0.6%,而MarginFlow在840行仍低于0.1 nat;在Bezáková等人构造的族上外推到训练行数的五倍。
启示与展望
该结果面向需要在给定行和列和下计数或均匀抽样二值矩阵的研究者,适用于生态学共现分析、Rasch模型条件推断、社会网络模体检验等以抽样加权平均为核心的场景。网络在部署时每个状态一次前向传播、无需在新边际上训练,一个检查点服务所有实验;用户也可在单个困难边际上继续训练,损失函数会报告对数权重的方差下降而无需知道计数。论文还指出,同一构造可扩展到整数项列联表、指定度序列图与含结构零的表,此时网络需读取列上超出缩减和的更多信息。
网络读取可行行类型,类型数随不同缩减列和的数目增长;训练限于每状态类型数低于设定上限、评估限于另一上限,类型远多于此时论文提出的按组放置的精确策略每次训练步耗时约九倍,是自然的后续版本。在509个超出精确计算上限的边际上,有效样本比例本身由抽样估计,论文用无偏计数估计作为交叉检查,并报告在94%的边际上MarginFlow与事后最优在蒙特卡洛误差内一致。此外,本证据包为全文,但图表以文字描述形式呈现,具体数值细节仍需查阅原文附录。
