重新评估异质图学习的进展:三类异质数据集划分与同质性度量的定量评测
核心概要
该工作对27个常用基准数据集上的基线模型进行超参数微调,依据图感知模型与其对应图无关模型的对比表现,将异质数据集划分为恶性、良性与模糊三类,并据此重新评估11个SOTA异质图模型、在三种合成图生成方法上对11个同质性度量做首次定量评测,发现多数SOTA模型并未显著优于最佳基线,且经典度量仍具竞争力。
Figure 1: Comparison of metrics on synthetic graphs with different generation methods. Note that Hnode overlaps with Hedge in Figure (e) and (f). In Figure (e), Hclass(G) overlaps with Hadj(G). KRL, KRNL and GNB overlaps in Figure (d).
· 第 8 页深度剖析
提出恶性、良性、模糊三类异质数据集的新分类法,并指出恶性与模糊异质才是真正具有挑战性的任务。 以往工作多以同质性数值高低判断数据集难度,该工作改为以图感知模型是否劣于其耦合的图无关模型作为判据,并首次提出这一分类法。 基于27个基准数据集上经微调的GCN、SGC-1与其耦合的MLP-2、MLP-1的对比结果,并报告了均值与标准差。
在微调超参数后重新评估11个SOTA异质图模型,发现仅ACM-GCN*、FSGNN、GloGNN*的整体平均排名优于最佳基线。 此前文献多报告异质专用模型优于基线,该工作在统一微调与分类评估下给出不同结论,并指出部分模型在简单图上牺牲性能换取困难图上的提升。 覆盖六类方法的11个模型在27个数据集上的平均排名统计,并标注了劣于最佳基线的结果与内存溢出(OOM)情况。
对11个同质性度量在三种合成图生成方法(RG、PA、GenCat)上进行首次定量评测,使用Pearson相关与Fréchet距离衡量度量曲线与GNN性能曲线的相似度。 以往评测依赖对曲线形状的观察式比较,该工作引入定量相似度指标,并指出结论高度依赖所选相似度度量与合成图类型。 在RG、PA、GenCat三类合成图上分别计算Pearson相关与Fréchet距离并给出平均排名,报告了经典度量与部分新度量在不同场景下的表现差异。
指出超参数微调对基线模型性能影响显著,在28个案例中有19个案例微调可显著提升性能。 该发现针对被认为对超参数稳健的数据集,说明未充分微调或搜索范围不足时报告的结果可能不可靠。 在Squirrel-filtered、Chameleon-filtered、roman-empire、amazon-ratings、minesweeper、tolokers、questions等数据集上对比微调前后GCN、MLP-2、SGC-1、MLP-1的表现。
启示与展望
该工作面向异质图节点分类的模型与度量评测,适用于使用这27个基准数据集或类似合成图生成方法的研究者;其分类法与评测流程可用于指导新模型与新度量的验证,并提示应综合三类合成图与多种相似度度量得出结论。
模糊异质数据集中图结构与模型非线性之间的协同关系目前尚无理论解释,作者也将其列为未来研究方向;此外,度量排名高度依赖所选相似度度量与合成图类型,读者在采纳具体度量建议时需结合自身场景综合判断。
