CONSISTRE 用一致性约束与蒸馏强化学习,让黑盒与 7–8B 开源模型在 DocRED 上的关系抽取更一致
核心概要
该工作提出 CONSISTRE,一个面向文档级关系抽取(DocRE)的统一一致性感知框架,包含两条互补路径:面向黑盒大模型的推理时路径(约束感知提示、基于约束的验证与迭代自我反思,无需任务微调)和面向小型开源模型的训练时路径(将强教师模型的推理轨迹经监督微调蒸馏给学生模型,再用 GRPO 与同时优化抽取性能与关系一致性的复合奖励对齐);在 DocRED 上两条路径均优于各自基线,推理时路径用现成黑盒大模型取得有竞争力的 F1,训练时路径以远低于专有大模型的推理成本显著缩小 7–8B 开源模型与最先进专有大模型之间的差距,消融研究显示显式一致性建模可缓解关系矛盾并提升可靠性。
Fig. 2: Per-type Cons across the three stages of Track B on the 200-document DocRED evaluation subset. SFT primarily contributes to inverse-relation Cons; GRPO primarily contributes to transitivity Cons (Qwen3-8B: +0.181; Qwen2.5-7B: +0.235). See Section IV-G for discussion.
arXiv深度剖析
提出统一的一致性感知 DocRE 框架 CONSISTRE,把关系约束(如传递性、对称性、函数唯一性)显式纳入抽取流程,覆盖 API 可访问与本地可部署两种场景。 以往基于大模型的信息抽取通常对每个候选三元组独立生成预测,可能违反基本关系约束而产生矛盾输出;该工作用统一的一致性表述把两类部署范式纳入同一框架。 摘要层面给出框架设计与两条路径的组成,具体约束形式与统一表述的细节未在摘要中展开。
推理时路径面向黑盒大模型,组合约束感知提示、基于约束的验证与迭代自我反思来精炼预测,无需任务特定微调。 把一致性处理放在推理阶段而非训练阶段,使无法访问权重或不便微调的现成黑盒模型也能受益。 在 DocRED 上该路径优于其基线,并使用现成黑盒大模型取得有竞争力的 F1;具体基线设置与数值未在摘要中给出。
训练时路径通过知识蒸馏与强化学习把一致性知识注入小型开源模型:先以监督微调把强教师模型的推理轨迹蒸馏给学生,再用 GRPO 与复合奖励对齐,同时优化抽取性能与关系一致性。 将一致性从推理时的提示与验证,转化为可训练目标中的奖励信号,使本地可部署的小模型获得一致性能力。 在 DocRED 上该路径显著缩小 7–8B 开源模型与最先进专有大模型之间的差距,且推理成本远低于后者;具体奖励权重与训练细节未在摘要中给出。
消融研究确认显式一致性建模可缓解关系矛盾,并提升两种部署范式下基于大模型的 DocRE 可靠性。 把一致性建模的贡献从整体性能中分离出来,说明收益并非仅来自更强的抽取能力。 摘要报告消融研究支持该结论,但未给出消融的具体配置与数值。
启示与展望
该工作面向文档级关系抽取,尤其是需要跨句、跨实体维护三元组一致性的场景;其推理时路径适用于只能通过 API 访问的黑盒大模型使用者,训练时路径适用于希望本地部署 7–8B 开源模型并控制推理成本的团队。摘要所述实验集中在 DocRED 这一数据集上,因此结论主要适用于该基准所代表的文档级关系抽取设定;一致性约束以传递性、对称性、函数唯一性等关系性质为例,适用于具备此类结构约束的关系类型。
摘要未给出 F1 的具体数值、基线配置、教师模型与学生模型的规模细节、复合奖励的构成与权重,也未说明消融的具体设置,因此无法判断一致性收益相对于抽取性能提升的幅度。约束验证与迭代自我反思在更长文档或更复杂关系类型上的表现、以及 GRPO 对齐的稳定性,仍是读者需要进一步确认的问题。由于当前仅基于摘要,上述细节均属未展开部分,需以原文为准。
