跳到主要内容
返回时间线
arXiv来源发表:

把自演化限制在运行时 harness 内并加一道准入闸门:7,449 个候选只放行 144 个,无有害变更,而取消闸门的同一循环放行了 309 个有害变更

核心概要

该工作主张 LLM 智能体的自演化只应发生在运行时 harness(指令文本、工具调用逻辑与类型化原语组合)而权重固定,并给出局部循环加全局循环、共用一道准入闸门的双循环引擎;在合成监管变动基准上(3 类再解释、3 档严重度、每格 10 个种子),闸门从 7,449 个候选中放行 144 个且无一在留出历史上加重错误,而把闸门换成无界系统所用的“近期轨迹中可见错误更少”检查后,同一循环放行了 309 个有害变更,90 次运行中有 49 次漏报率超过 10%。

AI-generated editorial illustration: The Harness as the Only Mutable Surface: Compliance-Bounded Self-Evolution of LLM Agents in Credit Pipelines, with a Measured Admission Gate

深度剖析

提出并实现“harness 是唯一可变表面”的架构:引擎可改写指令文本、工具调用逻辑和原语组合,不得微调,被服务的模型按摘要固定;局部循环每次改一个原语的一个参数或子句,全局循环从类型化库中替换原语,两者共用同一个回顾池和同一道闸门。 自演化文献把 harness 视为可优化的多个表面之一,本文把它当作机构唯一可让其演化的表面,从而把“智能体变了”从需要重新验证模型的事件变成带原因和测试的文本 diff。 架构与准入规则在代码中实现,编辑空间、库和准入规则均写入技术文档;实验为合成数据,智能体与提议者都不是语言模型。

测量了准入闸门本身:在 90 次运行中闸门从 7,449 个候选中放行 144 个,0 次有害放行,并在全部低、中严重度格中把假阳性率恢复到 oracle 水平且未抬高漏报率。 此前版本只规定了闸门而未测量,本文给出候选数、按原因分类的拒绝数、留出数据上的有害放行审计、一个完整拒绝案例以及闸门自身的失效模式。 3 类再解释 × 3 档严重度 × 10 个种子共 90 次运行,10 个对照臂,留出窗口每次运行 3,450 条警报,均值带 95% 区间;作者同时说明留出假放行审计因两半同源而偏弱。

给出标签来源的设计承诺:再解释发生后,回顾池必须按新规则重新标注,否则正确适配在旧标签下看起来就是回归;闸门在旧标签下拒绝了全部 8,490 个候选,包括 470 次拒绝完全正确的 harness。 把适配定位为“规则层面有人监督、harness 层面自主”,并指出重新标注的规则由合规职能编写,风险落在这一短小可审阅的产物上。 “旧标签闸门”臂在每一格都停留在退化后的假阳性率;该臂的 8,490 个候选全部因缺乏显著改进被拒,且全部未通过非回归条款。

刻画了两个循环的分工与代价:参数型与子句型变动由局部循环单独修复,结构型变动只能靠原语替换;双循环因升级路由而在结构族上比正确的单循环恢复更慢,并在恢复后仍产生被拒绝的额外提案。 消融实验显示升级机制无需被告知变动族别即可找到能表达修复的循环,且闸门拒绝无法表达的本循环候选,而不是放行其中“最不坏”的一个。 局部单循环在三个结构格中提出 1,890 个候选、放行 0 个,全部因回归被拒;算力对齐的局部单循环在中档格仍为 27.4% 对 27.4%。

启示与展望

该结果面向受监管信贷流水线中需要把智能体适配变成可审阅变更的团队,尤其是合规与模型风险职能:编辑空间、类型化库和准入规则可在部署前写入技术文档,使可达 harness 集合与放行规则成为“预定变更”,对应 EU AI Act 第 43(4) 条与第 3(23) 条;闸门在部署前写入哈希链记录,对应第 12 条记录保存与第 17(1)(a) 条变更管理。作者明确该设计适用于确定性流水线时审计性与行为可复现性重合,而托管 LLM 的行为可复现还需固定模型版本与解码参数、记录工具响应并在固定提示集上做金丝雀探测。作者也说明该边界有代价:指令文本与原语组合表达不了的任务落在循环之外,仍属工程工作。

作者列出的开放问题包括:智能体与提议者都不是语言模型,提议者是既定编辑空间上的种子搜索,库按构造含有正确替换原语,因此本轨道测量的是边界与闸门而非提议质量;换成 LLM 提议者会产生空间之外的候选,包括回归面更大的自由文本编辑,接口已能接受其一,这是下一步实验。数据全为合成,分布、变动族与反馈模型(全部标记复核、5% 的放行审计)均为作者设定,无闸门失效依赖“漏报比假阳性更不可见”这一不对称,其幅度是假设。执行噪声用共同随机数建模,真实 LLM 噪声不跨版本共享,会抬高回归条款的噪声底,从而加强采用按噪声缩放容差的理由。留出假放行审计按构造偏弱,因为两半是同一变动前流的交错划分并由同一确定性规则标注,故任何带闸门臂的零假放行属预期,有信息量的对照是无闸门臂与变动后留出窗口。未运行静态提示优化基线与所引自演化方法的直接实现;一次只测一个原语与一次变动,未测原语交互与并发变动;重新标注池的正确性不超过重标注规则本身;基准不含受保护属性,因此没有公平性主张,第 10 条偏差监测在设计中没有机制、实验中没有证据。此外,固定容差在高严重度结构格中拒绝了完全正确的替换(10 个种子中仅 5 个恢复,24 次拒绝正确 harness),作者提出按候选所改案例的预期噪声缩放容差作为下一版规则,并指出在两种容差取值下都没有有害变更被放行,因此该权衡的保护侧未被本轨道测量。

来源