跳到主要内容
返回时间线
arXiv来源发表:

EIO-Agents 提出证据到决策的语义层与可移植评估记录,使 243 条声明可复现地导出 BLOCK 决策

核心概要

该工作提出 EIO-Agents 开放规范,用评估智能本体(EIO)定义证据、谓词、声明、见证规则与证明状态,用可移植评估记录(PER)以内容寻址方式保存一次评估的证据到决策链,并给出开源参考实现;在信用承保智能体的参考评估中,243 条声明经投影、验证与解释后导出 BLOCK 决策,而同一分数在另一记录中因代理观察未复现只导出 REVIEW。

Source-provided article image: EIO-Agents: The Missing Semantic Layer for AI Agent Evaluation
Figure 1 ·

Figure 1: The EIO-Agents architecture. Evaluation systems produce evidence; EIO supplies the semantic contract that turns evidence into claims, proof status, and decisions; PER preserves the resulting evaluation as one content-addressed system of record. Metrics, findings, controls, and release recommendations are views over claims rather than independent facts.

arXiv

深度剖析

论文提出 EIO 语义层,其核心链为证据—谓词—声明—证明—决策,并给出可计算的见证规则、证明规则、复发带与发布语义。 既有基准、评测框架、LLM 评审与追踪系统各自产出分数或标签,但不共享“某条证据能确立什么”的规则;EIO 把观察与证据、证据与证明、判断与证明、分数与决策四组区分编码为机器可检查的规则。 规范以 41 个按版本与 SHA-256 摘要固定的 YAML 模块发布,含 58 个谓词、11 种证据类型、10 种来源类型、11 个解析器;见证规则在 110 个证据类型与来源类型配对中判定 11 个可见证、3 个需配对工具调用、13 个兼容但不可见证、83 个不兼容。

论文提出 PER 作为一次评估的规范记录,包含 14 个必需顶层块,并以内容摘要封存,使记录可被重新推导、解释与验证。 报告只是对评估的总结,而 PER 保存可再生成该报告的状态;记录摘要随档案、EIO 发布字节、PER 模式版本或转换代码输出变化而变化。 参考库提供 project、validate、verify、explain 四个操作;验证分为模式与发布、证据、声明、视图、解释、决策、记录卫生、推导八组检查;验证器自测向有效记录注入 31 个缺陷并要求全部被捕获,37 个构建门配 40 个负向量。

参考实现把语义变为可执行代码,并在三个参考评估上展示同一分数可导出不同决策、篡改可被检出、陪审团共识不构成证明。 该工作不是新评测器,而是让异构评测输出经声明映射后投影为可比较、可交换、可审计的记录;映射由生产者或适配器作者声明,EIO 不做模糊匹配。 FIN_3 记录含 243 条声明、12 项发现、readiness 49、状态 BLOCK,规范字节与仓库金记录一致;手工把 BLOCK 改为 PASS 后,模式检查、发布不变量 I-8 与再投影三项独立检查失败;EXAM_B 与 FIN_3 封顶分数同为 49,但前者代理观察 0/5 复现,状态为 REVIEW;三个记录共 618 条声明、58 项发现,其中陪审团产生 47 项发现,无一为 Proven。

论文把从开放规范走向共同标准列为设计目标,并给出独立实现、中立治理、中立命名空间、参考评分、签名证明与经裁定案例的路线图。 作者明确“标准”指面向共同采用的开放规范,而非已被标准机构认可的规范;语义核心(链、见证规则、证明规则、发布语义)当前已固定且可执行。 规范变更遵循公开流程:提案指明受影响标识符及对记录与摘要的影响、至少 14 天公众评议、带重新生成摘要与金记录的实现、维护者批准与新 EIO 发布;框架映射保持临时状态直至存在法律审查流程。

启示与展望

该规范面向需要跨工具、跨组织或跨监管边界交换评估结果的团队,例如评测框架作者、审计方、合规映射维护者与下游决策系统。它适用于任何能产出符合模式 bundle 的评测器,包括基准运行器、LLM 评审流水线与人工复核工具,并设计为映射到 EARL、PROV、in-toto 与 OpenTelemetry 等既有格式而非取代它们。验证所确立的是完整性与可推导性:记录格式良好、每个派生块与其声明和证据在捆绑的 EIO 发布下一致、摘要等于其规范字节的摘要,且用同一库版本投影给定 bundle 恰好得到该记录。规范同时声明验证不确立 bundle 来自真实运行、不确立智能体或陪审团会再次作出相同判断、不确立 Proven 声明为真,也不构成任何认证或法律合规。控制状态表达一次运行的证据相关性,所有框架映射均为临时并标记待法律审查。

读者仍需关注若干开放问题。参考评估中的三个档案由对抗式多轮 harness 产生,其复跑数据来自尚未发布的 harness 版本,因此复发带结论的可复现范围有待该版本公开后确认。第四个 bundle 来自虚构的原生生产者并系手工编写,说明原生记录在下一模式发布把标识符迁至中立命名空间后才完全符合模式。框架映射与 165 个控制全部为临时状态,需等待法律审查流程;控制状态不构成合规、认证或证明。语义解析器在当前规范下永不产生 Proven,因此仅由模型判断支撑的失败最高只能把发布建议提升到 REVIEW,需要人工裁定才能阻断发布;这一取舍对某些只能语义检测的危害意味着依赖人工流程。此外,验证不确立 bundle 来自真实运行,也不确立 Proven 声明为真,记录可能含个人数据需相应处理。

来源