arXiv 作者提出免训练的 CONTRA 方法,先广泛生成候选澄清问题,再按语义相关性过滤并用执行行为差异做资格判定,最后依据交互历史决定提问或停止;在 ClarifyCodeBench 上,CONTRA 在四个编码代理上均取得最高 F1,宏平均 F1 超过最佳基线 13.88 个百分点,并在相同 LLM 与评测协议下于澄清召回率和 F1 上超过 Claude Code 与 OpenHands,同时被实现为 Claude Code 插件。
作者提出免训练的 CONTRA 方法,先广泛生成候选澄清问题,再按语义相关性过滤并用执行行为差异做资格判定,最后依据交互历史决定提问或停止;在 ClarifyCodeBench 上,CONTRA 在四个编码代理上均取得最高 F1,宏平均 F1 超过最佳基线 13.88 个百分点,并在相同 LLM 与评测协议下于澄清召回率和 F1 上超过 Claude Code 与 OpenHands,同时被实现为 Claude Code 插件。
作者提出免训练的 CONTRA 方法,先广泛生成候选澄清问题,再按语义相关性过滤并用执行行为差异做资格判定,最后依据交互历史决定提问或停止;在 ClarifyCodeBench 上,CONTRA 在四个编码代理上均取得最高 F1,宏平均 F1 超过最佳基线 13.88 个百分点,并在相同 LLM 与评测协议下于澄清召回率和 F1 上超过 Claude Code 与 OpenHands,同时被实现为 Claude Code 插件。
作者提出免训练的 CONTRA 方法,先广泛生成候选澄清问题,再按语义相关性过滤并用执行行为差异做资格判定,最后依据交互历史决定提问或停止;在 ClarifyCodeBench 上,CONTRA 在四个编码代理上均取得最高 F1,宏平均 F1 超过最佳基线 13.88 个百分点,并在相同 LLM 与评测协议下于澄清召回率和 F1 上超过 Claude Code 与 OpenHands,同时被实现为 Claude Code 插件。