ARGUS 用证据审计气候政策 DID 研究的识别假设,在 11 个注入缺陷中检出 8 个,并在 26 篇经济学论文上对约六成维度评估选择弃权
核心概要
作者提出 ARGUS——一个把双重差分(DID)研究拆成十一个“假设—含义—证据”维度、用受限检索加相关性门控的大语言模型流水线来审计论文所报告证据是否足以支撑识别假设、并在检索不到相关证据时弃权的系统;在 11 个注入缺陷基准上检出 8 个(关键词基线为 2 个),在 33 个缺陷变体上检出 25 个,在 26 篇经济学论文上约六成论文—维度评估因无可检索证据而弃权,在 5 篇论文、55 个单元格的双标注者调和试点中,它在完成判断的 33 个单元格里有 25 个比人工标签更严厉,而一条在标签到达前固定的规则可在样本内把这一过严大幅削减。
深度剖析
ARGUS 把 DID 识别可信度操作化为可审计的十一个维度(平行趋势、无预期、交错处理、SUTVA 与溢出、对照组构造、设定、推断、样本期选择、并行政策、安慰剂/稳健性、数据测量),每个维度写成“假设—可检验含义—应有证据”,并以声明式配置文件保存,使被审计的维度显式可查。 既有计量文献已形式化交错时点与异质效应下的 DID 失效模式,但把每个已知威胁转成一篇具体论文中可逐条核查证据的审计清单,是这套工作新增的一层。 论文说明该清单与缺陷分类法一一对应,且每个注入缺陷都追溯到命名它的文献(附录 B 表 3),因此威胁目录是继承的,注入器措辞是作者自撰。
在 11 个注入缺陷基准上,两阶段 ARGUS 检出 8 个、误报 0 个,关键词基线检出 2 个;在 33 个变体基准上两阶段检出 25 个,逐维度提示但不检索的消融检出 29 个,单次整篇调用检出 24 个。 作者用“结构性扰动”替代“哨兵句注入”:遗漏类缺陷删除提供证据的章节、图表,改写类缺陷用自然散文写出设计问题且不含关键词检测器预定义的负面信号短语,并加回归测试防止短语泄漏。 论文报告初始实现因短语泄漏把检出率抬高,改用结构性扰动后重测;33 个变体上三次两阶段运行近乎确定(32/33 变体检出相同、31/33 风险标签相同),但作者指出各架构臂之间的配对差异在 n=33 时均未达显著。
在 26 篇标注为 DID 的经济学论文上,两阶段流水线约六成论文—维度评估为 unknown,即相关性门控找不到证据而选择弃权;检索质量弱时,判断往往给出高风险。 这暴露出检索而非判断是覆盖率的瓶颈,并把“检索失败”与“论文确实缺证据”区分开来:门控失败直接短路为 unknown,不调用判断模型。 论文报告该语料来自 CausalVerify 发布的 259 篇经济学论文中标注为 DID 的 26 篇,作者说明该标签未逐篇核验、其中一篇是文献综述、且没有一篇是狭义的气候政策评估。
在 5 篇论文、55 个单元格的双标注者调和试点中,ARGUS 弃权 22 个,完成判断的 33 个里有 25 个比人工标签更严厉、无一更宽松;一条在标签到达前固定、作用于弱检索高风险单元格的规则,把精确一致率从 0.24 提到 0.76,并把过严单元格从 25 降到 8。 作者把校准失败定位为“弱检索找不到证据”被当成实质性高风险,并给出可复现的降级规则;同时明确该提升是样本内结果,因为规则是在同一批论文上推导的。 两位非作者标注者独立标注、自行调和 13 个分歧单元格,独立标签在双方都评的 54 个单元格中 45 个一致;作者强调这是试点级信号,55 个单元格嵌套在 5 篇论文中,加权 κ 的区间包含零。
启示与展望
这套方法面向需要复核 DID 识别证据的实证研究者、期刊评审与政策分析人员,适用场景是论文已报告证据、需要定位最薄弱维度的审计流程;作者说明气候政策评估是清单设计的动机来源,而本次评测用的是合成环境政策夹具和一般经济学语料,专门的气候政策语料运行是自然的下一步测试。系统输出为研究—维度—风险三元组及证据链接理由,供人工做最终判断,不裁决因果效应。
作者列出的开放问题包括:金标为试点规模(5 篇论文、55 个单元格、两位标注者自行调和),其中 23 个单元格按类比方式解读维度,且标签以 medium 为主使精确一致率偏宽松;各架构臂在 n=33 上的配对差异均不显著,人类金标区间很宽;校准规则在同一批试点论文上推导并评分,样本外增益未检验;清单、缺陷分类法与注入器共同设计,合成检出率宜读作已知威胁下的内部一致性;平行趋势维度只是报告检查,不检验预趋势检验的统计功效;真实语料不含狭义气候政策评估。此外,本次加载的正文中若干数字在摘要与表格处显示为空缺,若需精确复现具体比例,应以原文表格与附录为准。
