MAGIC 用拓扑先验与漂移蒸馏实现免回放图小样本类增量学习,5-shot 平均准确率提升 5.48 个百分点
相关研究与后续进展核心概要
作者提出 MAGIC,一个免回放的图小样本类增量学习框架:它用冻结的图表示骨干配合闭式解析式持续学习,从基图学习可刻画同质与异质关系的拓扑先验并经 Potts 马尔可夫随机场推断注入以缓解新类过拟合,同时通过漂移感知解析蒸馏把受影响历史节点的旧预测迁移到新表示以缓解表示漂移;在五个数据集、八个基线的实验中,5-shot 下平均准确率与最终准确率分别提升 5.48 和 9.33 个百分点,性能下降减少 10.78 个百分点,且训练时间显著更少。
Figure 1: On the base stage, MAGIC learns a topological prior. In novel sessions, limited labeled supports first update an initial classifier, while drift-aware distillation protects historical nodes affected by cross-session edges. Finally, MAGIC extracts a subgraph around novel supports and performs Potts MRF inference with the topological prior to adjust the pseudo-labels predicted by the initial classifier, and subsequently updates the classifier using these adjusted labels.
arXiv深度剖析
MAGIC 把冻结图表示骨干与解析式持续学习结合,用累积充分统计量的闭式更新替代梯度式分类器更新,从而在不回放历史标注数据的前提下缓解灾难性遗忘。 既有 GFSCIL 方法多依赖伪增量元训练、原型记忆或伪标签校准,而 MAGIC 将分类器学习整体改写为闭式解析解,并让硬标签、蒸馏目标与 MRF 软监督通过同一套充分统计量注入。 论文给出统一的高斯工作似然推导,说明三类监督在数学上兼容;在五个数据集、八个基线上报告 MA、FA、PD 三项指标,结果均为五次运行均值与标准差。
MAGIC 从基图估计一个类别平衡的关系先验,刻画相连节点表示余弦相似度与标签一致性的关系,并通过 Potts 马尔可夫随机场推断为新类生成额外监督。 该先验只依赖标签是否一致而非具体类别身份,因此对类别置换不变,可同时表达同质与异质关系,突破了以往只在节点特征空间操作、忽略图拓扑模式的方法。 消融实验显示移除拓扑先验后平均准确率从 63.50 降至 53.69、最终准确率从 49.81 降至 37.29,是两项组件中影响最大的一项;超参数分析表明结果对先验分箱数几乎不敏感。
MAGIC 提出漂移感知解析蒸馏,度量跨会话边导致的历史节点表示漂移,并按归一化蒸馏质量把旧分类器在旧图上的预测迁移到更新后的表示。 论文用定理 1 说明固定图编码器并不意味着动态图上解析统计量固定,从而指出仅冻结编码器不足以防止历史表示漂移,这是既有 GFSCIL 工作较少建模的反向效应。 消融实验显示禁用蒸馏后平均准确率降至 61.88、最终准确率降至 48.02、PD 升至 36.16;超参数分析显示蒸馏质量存在保留与可塑性的权衡。
在五个节点分类基准、八个基线上,MAGIC 在 1-shot、3-shot、5-shot 设置下总体优于对比方法,并显著降低训练时间。 5-shot 下相对最佳基线平均提升 MA 5.48 个百分点、FA 9.33 个百分点,PD 平均降低 10.78 个百分点;1-shot 与 3-shot 下在每个数据集上取得最高 MA 与 FA,且优势随支持样本增多而更明显。 结果覆盖 CoraFull、Coauthor CS、Amazon Computers、ogbn-arxiv、WikiCS 五个数据集,报告五次运行均值与标准差;在 Amazon Computers 上 MA 略低于 GFCIL,但 FA 与 PD 最优。
启示与展望
该工作面向转导或动态可见的 GFSCIL 设定:MRF 推断需要访问支持集周围的未标注节点与边,因此最适用于相关邻域结构可获取的场景。方法兼容无参传播算子与冻结的预训练图编码器,便于按图特征选择骨干,例如 PPR 在两个引文网络上表现最好、RGVT 在 Coauthor CS 上最强、S2GC 在 Amazon Computers 与 WikiCS 上准确率最高。对希望避免回放历史标注数据、又需要持续接纳新类的图学习实践者,MAGIC 提供了闭式更新与拓扑先验注入的组合路径,并附带公开代码与逐数据集超参数。
论文自述两点范围限制:其一,方法未显式判断基会话学到的拓扑先验在每个新会话是否仍有益,当新类关系模式与基会话差异较大时,迁移先验可能提供有限甚至误导性的监督,未来可发展会话级先验有效性估计器;其二,MRF 推断依赖支持集周围的未标注节点与边,在严格归纳、隐私受限或拓扑不完整的场景中较难应用。此外,超参数分析显示蒸馏质量存在保留与可塑性的权衡,过大蒸馏会抑制新类学习,实际部署时该平衡点值得关注。
