跳到主要内容
返回时间线
arXiv来源发表:

CONTRA 用行为差异检验筛选澄清问题,在四个编码代理上取得最高 F1,宏平均超出最佳基线 13.88 个百分点

相关研究与后续进展

核心概要

作者提出免训练的 CONTRA 方法,先广泛生成候选澄清问题,再按语义相关性过滤并用执行行为差异做资格判定,最后依据交互历史决定提问或停止;在 ClarifyCodeBench 上,CONTRA 在四个编码代理上均取得最高 F1,宏平均 F1 超过最佳基线 13.88 个百分点,并在相同 LLM 与评测协议下于澄清召回率和 F1 上超过 Claude Code 与 OpenHands,同时被实现为 Claude Code 插件。

Source-provided article image: CONTRA: Discovering and Qualifying Behavior-Changing Questions for Selective Clarification in LLM Code Generation
Figure 1 ·

Figure 1: Overview of Contra for selective clarification.

arXiv

深度剖析

CONTRA 把澄清问题识别拆成“广泛发现 + 语义与执行双重资格判定”两阶段,并只保留会改变程序行为的问题。 既有方法难以在找出关键澄清问题的同时避免不必要提问;CONTRA 以“两个合理答案下生成程序、在共享输入上检查稳定行为差异”作为筛选依据,而非仅依赖语义判断。 摘要给出方法流程描述:生成候选问题、过滤与所需行为无关或已被需求解决的问题、对剩余问题做条件生成与行为差异检查、再用交互历史选择或停止;未在文本中给出各阶段的具体样本量或消融数据。

在 ClarifyCodeBench 上,CONTRA 在四个编码代理上均取得最高 F1,宏平均 F1 超过最佳基线 13.88 个百分点。 该结果把“选择性澄清”的收益从单一代理扩展到四个编码代理的一致表现,并给出与最佳基线的量化差距。 证据来自 ClarifyCodeBench 实验,报告的是 F1 指标与 13.88 个百分点的宏平均差距;文本未列出各代理的绝对 F1 数值、方差或显著性检验。

在相同 LLM 与评测协议下,CONTRA 的澄清召回率与 F1 高于编码框架 Claude Code 和 OpenHands。 这一比较把 CONTRA 与真实编码代理框架放在同一模型和评测条件下对照,而不只是与抽象基线比较。 摘要明确说明“same LLM and evaluation protocol”,并报告召回率与 F1 两项指标更高;具体数值未在文本中给出。

CONTRA 被实现为 Claude Code 插件,把选择性澄清嵌入日常开发流程。 方法不止停留在基准评测,还提供了可直接接入开发工作流的工程实现。 摘要陈述了插件实现这一事实;文本未提供插件的使用数据、部署规模或用户研究结果。

启示与展望

该工作面向使用编码代理进行代码生成、且需求存在欠定之处的开发场景,目标是在早期以尽量少的提问避免行为偏差。方法为免训练,因此适用于不便微调或希望快速接入的团队;插件形态指向日常开发工作流中的实际使用。评测范围是 ClarifyCodeBench 上的四个编码代理,以及与 Claude Code、OpenHands 在相同 LLM 与评测协议下的对照。

文本为摘要级内容,未列出各代理的绝对 F1、召回率数值、方差或显著性检验,因此难以判断 13.88 个百分点差距在不同代理间的稳定性。行为差异检查依赖“共享输入”的构造方式与两个合理答案的选取策略,这些细节在文本中未展开,可能影响资格判定的覆盖范围。交互历史如何影响“继续提问或停止”的决策阈值也未说明。此外,插件在真实开发流程中的使用效果、提问对开发者的打断成本是否被实际测量,仍是开放问题。

来源