arXiv 2026年5月11日作者提出图变换器语言模型(GTLM),通过在预训练 LLM 的注意力模块中直接注入图感知注意力偏置,使模型原生处理图拓扑,仅增加约 0.015% 的结构相关参数,并证明该双向注意力前缀对节点具有置换等变性、无图时精确退化为预训练模型;在文本属性图基准、WebQSP 上的 GraphRAG 以及分子基准上匹配或超越领域专用最先进模型,在 GraphQA 上显著优于强基线,且针在图中的准确率从 1k 到 64k token 保持平稳、超出训练长度 4 倍仍不下降,而同等训练的纯文本基线崩溃。作者提出图变换器语言模型(GTLM),通过在预训练 LLM 的注意力模块中直接注入图感知注意力偏置,使模型原生处理图拓扑,仅增加约 0.015% 的结构相关参数,并证明该双向注意力前缀对节点具有置换等变性、无图时精确退化为预训练模型;在文本属性图基准、WebQSP 上的 GraphRAG 以及分子基准上匹配或超越领域专用最先进模型,在 GraphQA 上显著优于强基线,且针在图中的准确率从 1k 到 64k token 保持平稳、超出训练长度 4 倍仍不下降,而同等训练的纯文本基线崩溃。GTLM 把图结构注意力偏置注入预训练 LLM,仅增 0.015% 结构参数即在图基准上匹配或超越专用模型作者提出图变换器语言模型(GTLM),通过在预训练 LLM 的注意力模块中直接注入图感知注意力偏置,使模型原生处理图拓扑,仅增加约 0.015% 的结构相关参数,并证明该双向注意力前缀对节点具有置换等变性、无图时精确退化为预训练模型;在文本属性图基准、WebQSP 上的 GraphRAG 以及分子基准上匹配或超越领域专用最先进模型,在 GraphQA 上显著优于强基线,且针在图中的准确率从 1k 到 64k token 保持平稳、超出训练长度 4 倍仍不下降,而同等训练的纯文本基线崩溃。作者提出图变换器语言模型(GTLM),通过在预训练 LLM 的注意力模块中直接注入图感知注意力偏置,使模型原生处理图拓扑,仅增加约 0.015% 的结构相关参数,并证明该双向注意力前缀对节点具有置换等变性、无图时精确退化为预训练模型;在文本属性图基准、WebQSP 上的 GraphRAG 以及分子基准上匹配或超越领域专用最先进模型,在 GraphQA 上显著优于强基线,且针在图中的准确率从 1k 到 64k token 保持平稳、超出训练长度 4 倍仍不下降,而同等训练的纯文本基线崩溃。