跳到主要内容
返回时间线
arXiv来源发表:

GTLM 把图结构注意力偏置注入预训练 LLM,仅增 0.015% 结构参数即在图基准上匹配或超越专用模型

相关研究与后续进展

核心概要

作者提出图变换器语言模型(GTLM),通过在预训练 LLM 的注意力模块中直接注入图感知注意力偏置,使模型原生处理图拓扑,仅增加约 0.015% 的结构相关参数,并证明该双向注意力前缀对节点具有置换等变性、无图时精确退化为预训练模型;在文本属性图基准、WebQSP 上的 GraphRAG 以及分子基准上匹配或超越领域专用最先进模型,在 GraphQA 上显著优于强基线,且针在图中的准确率从 1k 到 64k token 保持平稳、超出训练长度 4 倍仍不下降,而同等训练的纯文本基线崩溃。

Source-provided article image: Teaching LLMs to See Graphs: Unifying Text and Structural Reasoning
Figure 1 ·

Figure 1: GTLM architecture. Node texts are concatenated, and node-level topological biases b ⁡ ( u , v ) b(u,v) are broadcasted to constituent token pairs (where i ∈ u , j ∈ v i\in u,j\in v ) within the attention matrix. Graph structure is integrated using tunable attention biases and LoRA on a frozen base LLM.

arXiv

深度剖析

GTLM 让预训练 LLM 原生处理图拓扑,绕开了将文本节点属性压缩为单一 token 再交给 GNN 的多步流水线。 以往把 LLM 用于图数据通常依赖多步流水线并丢弃大部分语义内容,GTLM 直接把图感知注意力偏置注入 LLM 注意力模块,从而移除这一瓶颈。 摘要给出机制描述与参数开销(相对基座模型仅增加 0.015% 结构相关参数),并说明训练只更新结构参数与基座上的 LoRA 适配器。

作者证明双向注意力前缀在节点上具有置换等变性,且当输入不含图时 GTLM 精确退化为预训练模型。 这为“最小改动预训练 LLM”提供了形式化保证,说明结构注入不破坏原有语言能力,也不引入全局节点顺序依赖。 摘要以“We prove”陈述两项性质:置换等变性,以及无图时精确退化。

由于没有全局节点顺序,GTLM 不出现位置退化,也不“迷失在中间”:针在图中的准确率从 1k 到 64k token 保持平稳,并在超出训练长度 4 倍时仍不下降,而同等训练的纯文本基线崩溃。 这直接针对长上下文位置退化与中间信息丢失问题,给出结构感知注意力在长序列上的稳定性证据。 摘要报告了 1k 至 64k token 的准确率平稳趋势、4 倍训练长度外推,以及与同等训练纯文本基线的对比。

综合评测显示 GTLM 在文本属性图基准、WebQSP 上的 GraphRAG 以及分子基准上匹配或超越领域专用最先进模型,在 GraphQA 上显著优于强基线;其注意力头隐式学会模拟消息传递,解释了算法任务上的优势。 把结构推理与文本推理统一到同一骨干,并给出注意力头模拟消息传递的机制性解释,指向通用图学习骨干的可能性。 摘要以“Comprehensive evaluations”概括多类基准结果,并给出注意力头行为的机制观察。

启示与展望

该工作面向需要同时处理文本属性与图拓扑的任务,例如文本属性图基准、WebQSP 上的 GraphRAG、分子基准与 GraphQA;其设计意图是让预训练 LLM 在最小改动下成为通用图学习骨干。方法适用于可表示为图结构并需要长上下文结构推理的场景,尤其是节点无全局顺序、需要置换等变性的情形。对希望复用现有预训练 LLM、只训练少量结构参数与 LoRA 适配器的工程实践者,这一路线提供了可参考的接入方式。

摘要未列出具体基准名称、数据集规模、评测指标数值与统计显著性,也未说明基座模型规模、LoRA 配置与训练数据构成;长上下文针在图实验的具体设置与“崩溃”基线的细节同样未展开。注意力头模拟消息传递的结论来自机制观察,其可解释性与因果性仍需更多验证。读者若需复现或评估迁移效果,应查阅正文中的实验表格与消融设置。

来源