把治理评审门禁交给智能体:DGF-Bench 上最强模型严格门禁成功率 94.98%,但完整路线成功率仅 76.92%
核心概要
该工作提出面向数字治理框架(DGF)的任务替代框架,把每个治理门禁视为可执行契约,要求信息充分、决策与权限校验有效,并在计入例外、核验、纠错与维护后仍能减少总人力;作者推导出残余工作量阈值,说明为何自动化大多数案例仍可能增加劳动,并用 DGF-Bench(300 个合成项目、899 次可评估的模型-项目运行)测量模型表现:Gemini 3.8 Flash、GPT-5.6 Luna、DeepSeek v4.1 Flash 的严格门禁成功率为 94.98%、83.29%、74.18%,完整路线成功率为 76.92%、42.33%、24.67%,确定性对照在给定规则与结构化事实下通过全部 1,700 个门禁,证据审计与 135
Figure 5: The generated architecture document in Project Falcon’s actual dossier. The diagram is review evidence, not an independently validated production design. Identity, application, data, monitoring, backup, and recovery elements contextualize the readiness example.
arXiv深度剖析
论文把企业治理中的每个评审门禁建模为可执行契约,并提出任务替代框架:只有当可获取信息充分、决策与权限校验有效、且计入例外、核验、纠错与维护后总人力仍下降时,才应替代人工执行。 相对于把治理自动化简单等同于“让模型做判断”的做法,该框架把替代条件写成可检验的契约,并推导出残余工作量阈值,指出自动化大多数案例仍可能增加劳动。 该框架以形式化条件与阈值推导呈现,并在 DGF-Bench 的受控设置中检验;文本为摘要级,未给出推导细节与阈值数值。
DGF-Bench 提供 300 个合成项目与 899 次可评估的模型-项目运行,测得 Gemini 3.8 Flash、GPT-5.6 Luna、DeepSeek v4.1 Flash 的严格门禁成功率为 94.98%、83.29%、74.18%,完整路线成功率为 76.92%、42.33%、24.67%。 该基准把“单个门禁判断正确”与“整条路线走通”分开度量,显示两者之间存在明显落差,而此前讨论多停留在单点判断能力。 证据来自受控合成项目上的可评估运行计数,并配有证据审计与 135 次重复运行以区分决策正确与执行可靠。
确定性对照在给定规则与结构化事实下通过全部 1,700 个门禁,从而把模型比较定位在“执行给定决策内核”这一环节。 该对照把任务难度归因于执行而非决策规则本身,为解读模型成功率提供了参照点。 对照在相同规则与结构化事实输入下通过全部 1,700 个门禁,属于受控条件下的确定性结果。
一个文档反例确立了信息充分性障碍,说明当可获取信息不足时,替代条件无法满足。 该反例把“信息是否充分”从工程细节提升为替代能否成立的前置条件。 以单个文档反例形式给出,属于存在性论证,而非覆盖性统计。
启示与展望
该工作面向把已明确规定的治理评审任务交由智能体与软件执行的技术可行性,适用对象是希望评估门禁替代的治理与工程团队,前提是门禁规则与结构化事实可被供给。框架给出的劳动力检验以固定产出与质量下的完整人力投入为准,而当前测量只覆盖评审表现,因此结论应理解为在受控合成设置下对替代条件的检验,而非对真实组织人力变化的观测。
文本为摘要级,未给出残余工作量阈值的具体形式与数值,也未说明 300 个合成项目的构造方式、门禁类型分布与评分细则,因此无法判断成功率对项目难度的敏感程度。确定性对照通过全部 1,700 个门禁是在给定规则与结构化事实下取得的,模型在信息不完整或规则需推断时的表现仍待观察。文档反例只确立信息充分性障碍的存在,其覆盖范围有限。此外,劳动力检验所需的完整人力投入尚未测量,替代是否真正减少总劳动仍是开放问题。
