基于原子命题图的自然语言推理:可解释性的代价有多大?
核心概要
该研究构建了一条完全基于图的自然语言推理流水线:把前提与假设分解为原子命题,经受限解码转成 ConceptNet 三元组,再连同检索到的 ConceptNet 子图序列化后送入微调的 Qwen3.5-0.8B-Base 分类器,分类阶段完全不接触原始文本;在 SNLI 上达到 89.7% 准确率,仅比同骨干的文本模型低 1.9 个百分点,在 ANLI 上 R2、R3 与已发表的 RoBERTa-large 相当(48.0% 对 48.9%、44.9% 对 44.4%),但 R1 落后 16 个百分点,整体比文本对照低 9 至 14 个百分点,作者称之为“可解释性的代价”,并通过消融与数据扩展实验表明该差距来自表示能力而非数据不足。
Figure 1: The four stages of the pipeline. Both sentences of the pair are decomposed into atomic propositions, each proposition is converted into ConceptNet triples under a constrained JSON schema to form the premise graph P and the hypothesis graph H, a third graph K is retrieved from ConceptNet, and the three graphs are serialised in the order K, P, H for the classifier. No natural language text reaches the classification stage.
arXiv · 第 2 页深度剖析
提出一条分类器从不接触原文的图式 NLI 流水线,包含 28 个 ConceptNet 关系的抽取词表与受限 JSON schema。 与以往把文本与图同时输入的做法不同,这里通过移除文本使中间结构成为决定性因素:图中的错误即预测的错误,每个预测都可追溯到有限的三元组列表。 流水线四阶段(原子化、三元组抽取、知识增强、分类)在正文与附录中完整给出,含提示词、schema 与复现代码;抽取平均每个命题产生 3.6 个三元组。
以同一骨干、同一优化器与相同训练轮数的对照方式量化“可解释性的代价”。 把可解释性代价定义为一个可测量的量,而非定性描述:SNLI 上为 −1.9 个百分点,ANLI 上为 −9 至 −14 个百分点。 图模型在 SNLI 上为三个随机种子的均值 0.897±0.006,文本对照为 0.916;零样本对照显示 0.8B 基座在文本与图输入下均处于随机水平(SNLI 0.343)。
通过数据扩展实验论证差距源于表示而非数据。 加入 MNLI 与 FEVER-NLI 约 60 万训练对后,ANLI 仅提升约 0.6 个百分点,说明扩大数据规模不是缩小对抗性差距的路径。 两阶段训练后 ANLI R1–R3 为 0.568、0.479、0.461,对照无额外数据时的 0.565、0.462、0.463。
消融显示外部知识与图-文本互补性:SNLI 上移除 ConceptNet 子图 K 无损失,而图与文本结合把准确率从 0.916 提升到 0.921。 把外部知识检索的贡献与多模态组合的贡献分开测量,指出在简单推理场景中多跳检索可能冗余,而图作为文本的补充仍有增益。 两项消融均在同一 Qwen3.5-0.8B 骨干与协议下进行(seed 0),P+H+K 为 0.892,P+H 为 0.895。
启示与展望
该结果适用于以可审计中间结构为目标的英文 NLI 场景:在 SNLI 这类单句图像描述式前提上,图式流水线几乎追平文本模型;在 ANLI 这类对抗性长前提上,它在 R2、R3 与已发表的 RoBERTa-large 相当。它使研究者与审计者能够把一次预测定位到具体三元组,并据此编辑后重新送入分类器;作者也指出,这一可解释性主张仍需通过让标注者修改三元组来修复错误预测的人类研究来直接检验。
读者可继续关注:ConceptNet 子图 K 在 ANLI 上的作用尚未做无 K 消融,其多跳检索对对抗性推理是否有帮助仍待评估;原子化器在 7% 的 ANLI 句子上出现重复循环,清洗步骤本身可能丢失事实,且共指错误会被静默固化进前提图;时间与空间粒度、比较与标量表达、命题态度与情态在 28 关系词表中没有忠实对应;此外可解释性目前是定性的,尚未以人类可读性指标量化。
