跳到主要内容
返回时间线
arXiv来源发表:

PlanPool 将澄清计划外化为可变问题池,在三个基准上提升歧义覆盖并减少静默失败

相关研究与后续进展

核心概要

该工作指出智能体式 Text-to-SQL 中执行结果正确并不等于已充分消解查询的欠规范,因为智能体可能静默做出恰好命中预期答案的未经验证假设;作者将这一行为部分归因于过早终止澄清,并提出 PlanPool,把澄清计划外化为可变问题池,要求每个计划问题在提交前被显式提问或丢弃、并允许交互中新增歧义,在三个由 BIRD-Interact 与 Spider 衍生的基准上一致提升歧义覆盖、减少静默失败,同时保持有竞争力的执行准确率。

Source-provided article image: Beyond Correctness: Resolving Underspecification in Agentic Text-to-SQL

(a)

arXiv

深度剖析

论文提出并验证了一个区分:在智能体式 Text-to-SQL 中,执行结果正确并不必然意味着底层欠规范已被充分消解,智能体可能静默做出未经验证的假设而恰好匹配预期答案。 此前对这类系统的评价通常以执行正确性为核心,该工作把“正确性”与“欠规范是否被真正解决”拆开,指出二者可以分离。 依据摘要中报告的行为观察:正确执行结果不必然意味着欠规范被充分消解,且该行为部分由过早终止澄清驱动。

作者将上述失败模式部分归因于过早的澄清终止,并报告强制智能体提出更多问题可提升执行准确率,但歧义集中在较早的交互中,因此暴力式提问效率不高。 把失败来源定位到澄清过程的终止时机,同时说明单纯增加提问数量并非高效解法。 摘要中报告了强制多提问与执行准确率之间的关系,以及歧义在交互中分布不均的观察。

论文报告即使显式提示智能体规划其澄清过程,智能体仍频繁放弃它已经识别为相关的问题。 说明“识别缺失信息”与“可靠地维持并解决这些信息”是两种不同能力,提示式规划不足以弥合这一差距。 摘要中报告了在显式规划提示下仍出现放弃已识别相关问题的现象。

作者提出 PlanPool,将澄清计划外化为可变问题池:每个计划问题必须在提交前被显式提问或丢弃,交互中新发现的歧义可被加入;在三个由 BIRD-Interact 与 Spider 衍生的基准上,它相对无约束与基于提示的替代方案一致提升歧义覆盖、减少静默失败,并保持有竞争力的执行准确率。 以外部化、可变且带提交前处置约束的问题池机制,替代仅靠提示让智能体自行维持澄清计划的做法。 依据摘要中报告的三基准对比结果:歧义覆盖一致提升、静默失败减少、执行准确率保持有竞争力。

启示与展望

该结果面向需要在生成 SQL 前与用户交互澄清欠规范的智能体式 Text-to-SQL 场景,适用于以歧义覆盖与静默失败为关注点的评测设置;其证据来自三个由 BIRD-Interact 与 Spider 衍生的基准,因此结论的适用范围以这些基准所代表的交互式查询任务为界。对希望降低“看似正确但基于未验证假设”风险的开发者,PlanPool 提供了一种把澄清计划外化并强制逐项处置的做法;对研究者,它把评价焦点从单一执行正确性扩展到欠规范是否被真正解决。

摘要未给出各基准上的具体指标数值、样本规模与统计细节,因此提升幅度与稳定性仍需查看正文;歧义集中在较早交互这一观察的具体分布形态、以及“静默失败”的判定方式,摘要中未展开;PlanPool 在问题池规模增长或用户交互轮次受限时的表现,属于可进一步观察的开放问题。

来源