RegLLM 诊断框架在两次同配置 GPU 试点中暴露方差:升级召回率 1.0 对 0.5,同一适配器效果方向翻转
核心概要
作者提出 RegLLM——一个面向受监管智能体工作流的“有限自主”诊断框架,用六项可信度信号(引用有效性、来源接地、模式合规、升级正确性、宪法对齐、不安全动作率)配合确定性运行时监督器,在离线参考运行(n=12)中把升级召回率从 0 提升到 0.67、把不安全动作率从 0.33 降到 0.08,而在两次名义同配置的单卡 Qwen2.5-3B LoRA/DPO 试点(n=8,同种子同评测划分)中观察到任务成功率 0.25 对 0.12、升级召回率 1.0 对 0.5,且同一答案质量适配器对升级召回的影响在两次运行间方向相反,说明该规模下适配器效应无法与采样和硬件方差区分。
深度剖析
把“作答还是转交人工”的决策变成可验证的训练信号:每个任务带 should_escalate 标签,奖励检查智能体的终局决策是否与该标签一致,正确升级与正确引用条款一样计入轨迹得分。 此前受监管工作流中的升级判断依赖手写阈值,而可验证奖励方法(如数学、代码)依赖机器可判定的答案;该工作把升级正确性归入程序化可验证信号一类,使有限自主行为可测量、可训练、可审计。 论文给出混合奖励公式与四类程序化子信号(引用有效性、来源接地、模式合规、升级正确性)的定义,并说明标签在本文中由模板生成、生产环境需专家标注。
同一份领域宪法同时充当混合奖励的软项与运行时护栏:16 条英国 FCA 原则既用于 AI 评委打分,也用于确定性监督器阻断无依据回答、在越界触发时强制升级,并按触发的原则编号写入仅追加审计日志。 既有宪法式 AI 工作多把原则集用于生成偏好数据再喂给下游对齐流程,护栏系统则独立于智能体之外;这里同一个制品同时治理评测、训练与服务。 论文描述了 Constitution 接口、GovernedAgent 与审计日志机制,并给出离线参考运行中监督器带来的指标变化。
离线参考运行显示确定性监督器在弱基线上有效:升级召回率从 0 升到 0.67,引用有效性升到 1.00,不安全动作率从 0.33 降到 0.08,任务成功率从 0.08 升到 0.25。 该结果把运行时治理的贡献从学习到的策略行为中隔离出来,说明在不会自行延迟作答的策略上,硬规则能直接改变有限自主指标。 基于 12 个留出任务的离线参考运行,使用确定性词法基线策略与离线启发式评委。
两次 GPU 试点的主要经验发现是方差本身:同代码提交、同评测划分、同种子、同基座与超参下,RL-base 的任务成功率 0.25 对 0.12、升级召回率 1.0 对 0.5、引用有效性 0.50 对 0.38;答案质量适配器在 Run A 使召回从 1.0 降到 0.5,在 Run B 却从 0.5 升到 1.0;专为 Run A 假设失败模式设计的升级感知变体在 Run B 无可测变化。 论文明确不把任一方向解读为适配器真实行为,而把两次运行的对比作为证据:在 8 个任务、10–20 条偏好、30 步 DPO 的规模上,适配器效应无法与浮点顺序、内核选择、依赖微版本等方差分离。 两次单卡 Qwen2.5-3B LoRA/DPO 试点,n=8,同种子同评测划分,仅 GPU 主机不同;作者说明未固定容器镜像摘要与 CUDA 确定性标志。
启示与展望
该框架面向满足三个条件的团队:所在领域有书面规则手册、有办法识别哪些查询超出智能体范围、且有一个可微调的小型开放基座模型。它适用于金融合规这类“错误答案意味着监管罚款、客户受损或义务遗漏”的工作流,也适用于数据保护、临床指引、税务等可自备原则集的领域。编排层(租用 GPU 生命周期与保证销毁、S3 暂存制品、可验证奖励驱动的训练)对任何做成本受限 RL 试点的团队都可独立复用。论文明确说明这不是开箱即用的安全产品,宪法、语料与升级标签仍需实践者自行完成。
升级正确性的可验证性取决于 should_escalate 标签本身是否可靠,而本文标签由模板生成、未经法律合规专家标注,也未报告评分者间一致性,因此标签质量对结论的影响仍是开放问题。宪法对齐分依赖模型评委,本文使用启发式评委以保证可复现,换成托管 API 评委预计会得到不同的绝对分数,评委校准与偏差尚未处理。运行时监督器在两次 GPU 试点中干预次数为零,因为模型在每个作答轮次都引用了条款、而漏升级的轨迹未到达可被检查的终局回答,因此基于评委的能力边界触发机制需要推理时可用的已校准评委或更丰富的基座行为。两次运行未固定容器镜像摘要与包微版本、未启用 CUDA 确定性标志,方差来源只能列为候选而非确证。此外,本次加载的是全文,但表格中的部分数值在正文中以占位形式呈现,若需逐项核对具体数字仍应回到原文表格。
