跳到主要内容
返回时间线
arXiv来源发表:

G2MLP 用 Ollivier–Ricci 曲率分层蒸馏监督,在六个节点分类基准上全部取得最佳无图学生精度,Citeseer 提升 4.02 个百分点

核心概要

作者提出 G2MLP:一种训练期 GNN 到 MLP 蒸馏框架,用 Ollivier–Ricci 曲率把监督分配到预测层与表示层,以纠正稀疏图上的谱欠拟合与稠密图上的谱过拟合;在六个节点分类基准上,无图 MLP 学生均取得最佳精度,并在 Graph Transformer 教师与链接预测上无需改动架构即可迁移。

Source-provided article image: Distilling Graph Geometry: Knowledge Gap from GNNs to MLPs
Figure 1 ·

Figure 1: Two spectral failure modes of GNN-to-MLP distillation. (a) Singular-value spectra: GLNN exhibits spectral underfit on sparse graphs and spectral overfit on dense graphs. (b) Rank-direction sketch. (c) Per-dataset rank gap.

arXiv

深度剖析

论文把 GNN 到 MLP 蒸馏的失败模式归纳为两种谱失配:稀疏图上学生有效秩低于教师、缺失边界区域的高能教师方向,称为谱欠拟合;稠密图上教师经聚合塌缩为低秩几何,而仅用特征的学生保留了教师不支持的方向,称为谱过拟合。 此前方法主要迁移逐节点预测或用教师置信度重加权,未指明学生应在何处保留教师的图诱导几何;该工作把失配定位到表示空间的谱结构,并把它与边界/内部图区域对应起来。 基于 GNN 核与 MLP 核的差异分析:Lemma 3.1 说明图相关聚合分量由 -hop 感受野内的路径生成,Proposition 3.2 在 Lipschitz 假设下给出 ORC 与局部随机游走邻域对齐难度的上界关系;作者明确说明这些是结构性上界,不声称曲率精确估计核谱。

论文推导了一个能量加权对齐目标,说明逐点 KL 蒸馏不足:两个学生可以匹配相同 logits 却诱导不同的邻域表示几何,因此需要额外对邻域级师生对齐敏感的项。 把蒸馏目标从逐节点散度扩展到教师核特征基下的能量加权对齐,并指出高能教师方向应获得更大权重。 该目标因需要存储并对角化完整教师核而不可直接计算,论文将其作为原则性目标,用局部、曲率引导的对齐来近似。

G2MLP 用 ORC 作为局部代理分配监督:低曲率边界节点获得更强的预测层监督以纠正谱欠拟合,高曲率内部节点获得更强的表示层邻域对齐以抑制谱过拟合;表示项采用闭式对角高斯代理,所有图相关量仅在训练期使用。 把重加权与图拓扑量(曲率)而非教师置信度绑定,并采用符号相反的单调权重同时作用于 logit 侧与特征侧。 消融显示:均匀权重下的对齐相对 GLNN 中性(Cora 80.86 对 80.26,Citeseer 71.07 对 71.22,Pubmed 75.22 对 75.59);单侧曲率分层已带来大部分提升(约 1.5–2.2 个百分点),双侧组合最佳(Cora 82.54、Citeseer 74.51、Pubmed 78.17),与第 3.2 节预测的符号相反分层一致。

在六个节点分类基准上,G2MLP 在转导设置下全部取得最佳无图精度,比最强基线高 0.16–1.66 个百分点,并在六个数据集中的五个超过 GraphSAGE 教师(Citeseer 最多 +4.02 个百分点);归纳设置下在 Cora、Citeseer、Pubmed、A-computer 上提升 2.07–2.69 个百分点。 归纳场景的增益明显大于转导场景,提示曲率分层对齐比逐节点蒸馏更好地迁移到未见节点;同一配方无需改动架构即可迁移到 Graph Transformer 教师与链接预测。 报告 10 个随机种子的均值与标准差;ogbn-Arxiv 上学生仍低于教师 6.16 个百分点,作者将其归因于该大规模图上仅用特征推理的已知困难。

启示与展望

该结果面向同配节点分类基准(Cora、Citeseer、Pubmed、A-computer、A-photo、ogbn-arxiv),在这些图上邻域高斯统计可靠、对角矩代理有依据;部署形态是标准 MLP,推理时无需邻域抓取、采样或图遍历,因此适用于延迟敏感、图访问受限的场景。曲率作为一次性图级预处理计算并缓存,可摊销到所有训练轮次与部署;对精确 ORC 代价过高的图,可用 Sinkhorn 正则化最优传输或 Forman–Ricci 曲率替代。方法同样适用于 Graph Transformer 教师与链接预测,后者需要按数据集验证特征侧权重的符号方向。

理论结果(Lemma 3.1 与 Proposition 3.2)是上界与结构性陈述,未建立匹配下界,也未证明曲率分层对弥合谱失配是必要的;哪些图与哪些教师核真正需要曲率自适应处理仍是开放问题。对角高斯邻域代理仅在邻域分布本身为对角高斯时精确,对多模态或强异配邻域可能低估对齐代价,混合高斯或低秩协方差扩展尚未验证。实证评估限于同配基准,强异配图(如 Texas、Wisconsin、Chameleon、Squirrel)上的表现与是否需要符号翻转权重仍待系统检验。此外,ogbn-arxiv 上学生仍低于教师 6.16 个百分点,大规模图上仅用特征推理的差距尚未闭合。

来源