图节点分类的认知不确定性新框架:EDL方法不满足信息增长一致性,图自助集成可恢复不确定性收缩
相关研究与后续进展核心概要
该工作为节点分类中的认知不确定性提出首个统计框架,包含信息增长实验协议与一致性判据,并借助投影图数据生成过程保证嵌套图来自同一过程;分析表明图证据深度学习(EDL)方法在总体最优处保留非消失的认知不确定性、且其认知与偶然不确定性由超参数外部调节,从而不满足一致性,而图自助集成(GB-Ens)通过图重采样与随机训练同时刻画数据与过程不确定性,在相同协议下表现出超越标准深度集成的认知不确定性收缩。
(a) Epistemic uncertainty under information growth.
arXiv深度剖析
提出节点分类中认知不确定性的首个统计框架,包含信息增长实验协议与一致认知预测器定义。 以往图EDL方法在固定图上依据特征支持、结构支持与邻域冲突等图特定原则构造认知不确定性,并在OOD检测等下游任务上评估,无法检验其随数据生成过程信息增加而可约简的性质;该框架首次将i.i.d.设定下的可约简刻画扩展到节点分类。 框架由三部分构成:以观测图(诱导子图)为采样单元、以投影图数据生成过程保证嵌套图来自同一过程、并要求学习任务随图增大而扩展;一致性判据要求不确定性单调下降并渐近收敛到贝叶斯最优预测器处的狄拉克分布。
统一图EDL目标并刻画其总体最优,表明其认知不确定性由超参数外部调节而非显式估计数据不确定性,因而不满足一致性。 将S-BGCN-K、GPN、GPN-LOP、CUQ-GNN等方法的训练目标统一为一个带温度参数的EDL损失,并给出总体最优的解析形式,从而在共同框架下比较这些方法。 定理4.3给出统一损失的总体最优;对固定有限参数,GPN、GPN-LOP与CUQ-GNN在总体最优处保留非消失的认知不确定性;S-BGCN-K在稠密图子设定下证据分布收敛到狄拉克,但其位置依赖GKDE构造且未必贝叶斯最优,且MC dropout下认知不确定性未必消失;受控信息增长实验证实认知不确定性集中不足与参数化依赖。
提出图自助集成(GB-Ens),通过图重采样与随机训练同时刻画数据与过程不确定性,在相同协议下表现出认知不确定性收缩。 将i.i.d.设定下自助集成可同时捕捉数据与过程不确定性、并已被证明在适当条件下渐近收敛到贝叶斯对应量的思路扩展到图,采用保留节点身份、特征与标签的边级局部非参数自助重采样。 在指数衰减图子与SBM两个投影图数据生成过程上,GB-Ens的认知不确定性随图规模单调下降(指数衰减图子上GCN、APPNP、GAT分别下降相应比例),其随机种子与自助两个分量均随信息增加而下降;标准图深度集成(G-Ens)未表现出一致的认知不确定性收缩;与真实DGP重采样的归一化Wasserstein-1距离在APPNP与GCN上保持较小且稳定,GAT上随图增大而上升。
启示与展望
该框架适用于能够定义投影图数据生成过程的设定,即嵌套图观测是同一底层过程的相干观测;实验在指数衰减图子与SBM两个合成投影图子上进行,覆盖连续与离散结构、平衡七类节点分类问题,图规模对数间隔取六个取值。对希望评估或设计图认知不确定性预测器的研究者,该协议提供了在信息增长下检验可约简性的可操作标准;GB-Ens在保留节点身份、特征与标签的边级自助重采样下实例化,可通过并行训练与顺序推理控制峰值内存。
自助式图认知预测器的理论一致性仍有待建立;信息增长行为无法在缺乏相应采样过程的标准真实基准上评估,因此结论目前主要建立在合成投影图子上。近似质量随预测器而异,GAT在真实DGP重采样诊断上的Wasserstein-1距离随图增大而上升,且其认知不确定性收缩较弱且部分非单调,提示收缩依赖底层学习过程的正则性。此外,本地自助并不保留观测图的全部拓扑性质,其作为图观测变异近似的保真度有限。原文中部分表格数值在加载文本中缺失,因此对具体数值的复述以正文明确给出的比例与距离区间为准。
