跳到主要内容
返回时间线
arXiv来源发表:

EAGER 用可验证奖励强化学习提升生成式事件抽取,在七个基准上超过提示、监督微调与既有强化学习基线

核心概要

该工作提出 EAGER,一个面向生成式事件抽取的强化学习框架,将细粒度可验证奖励与 Schema-Contrastive Advantage Estimation 结合,以缓解稀疏二值奖励下的优势坍缩;其奖励设计显式覆盖结构有效性、抽取准确率、接地性、覆盖率、过度生成与跨度精确度,在七个基准数据集上持续优于提示、监督微调与既有强化学习基线,并相对最强先前方法取得显著提升。

AI-generated editorial illustration: EAGER: Enhancing Generative Event Extraction via Reinforcement Learning with Verifiable Rewards

深度剖析

EAGER 把生成式事件抽取建模为可用可验证奖励优化的强化学习问题,奖励信号显式针对结构有效性、抽取准确率、接地性、覆盖率、过度生成与跨度精确度六个方面。 相对于仅依赖提示或监督微调的做法,该工作把任务对齐的细粒度可验证奖励引入端到端事件抽取,使触发词识别、事件类型分类与 schema 约束论元跨度抽取在同一奖励框架下被直接约束。 原文以奖励设计说明与七项基准实验作为支撑,属于方法描述加基准对比层面的证据。

EAGER 引入 Schema-Contrastive Advantage Estimation,用于缓解稀疏二值奖励下的优势坍缩问题。 既有强化学习基线在稀疏二值奖励下容易出现优势信号退化,该工作以对比式优势估计作为针对性机制,属于方法层面的新增组件。 原文将该机制作为框架核心提出,并以相对既有强化学习基线的实验比较作为支持。

在七个基准数据集上,EAGER 持续优于提示、监督微调与先前强化学习方法,并相对最强先前方法取得显著提升。 该结果把可验证奖励与对比优势估计的组合效果放到多数据集横向比较中检验,而非单一数据集上的个例表现。 证据来自七项基准上的对比实验,原文以“consistently outperforms”与“substantial improvement”概括,未在摘要中给出具体数值。

启示与展望

该工作面向端到端生成式事件抽取,适用于需要同时输出触发词、事件类型与 schema 约束论元跨度的抽取场景,并以七个基准数据集作为主要验证环境。其可验证奖励设计针对结构有效性、抽取准确率、接地性、覆盖率、过度生成与跨度精确度,因此最直接受益的是有明确 schema 与可自动校验输出的抽取任务;对缺乏可验证信号或 schema 不固定的抽取设定,原文未给出适用性说明。

原文为摘要级文本,未提供各基准上的具体指标、提升幅度、统计显著性、奖励各项的权重设置,也未说明 Schema-Contrastive Advantage Estimation 的具体计算形式与消融结果。因此读者仍需关注:相对最强先前方法的“substantial improvement”具体量级如何,六类奖励各自贡献多少,以及优势坍缩的缓解是否在不同事件类型与 schema 复杂度下一致成立。

来源