跳到主要内容
返回时间线
arXiv来源发表:

AdaGuard用自适应护栏模型按用户自定义策略审查智能体轨迹,4B模型在AdaptiveSafety上达到89.30%二分类准确率

核心概要

该工作提出AdaptiveSafety数据集(10,939条训练样本、1,000条测试样本,策略含1至100条规则)与SafePO强化学习算法,并据此训练出0.6B、4B、8B三档AdaGuard护栏模型,在推理时按用户提供的策略评估智能体轨迹;其中4B模型在AdaptiveSafety与DynaBench上分别取得89.30%和71.82%的二分类准确率。

AI-generated editorial illustration: AdaGuard: An Adaptive Guard Model with User-defined Policies

深度剖析

提出AdaptiveSafety数据集,把策略变化与行为变化同违规判定结果对应起来。 既有护栏数据集多在预定义安全标准下标注提示与回复,而该数据集同时包含策略反事实(改变权限、条件、阈值或例外而保持轨迹不变)与行为反事实(保持策略而改变授权、拒绝与执行、工具返回结果等记录事实),并配有结构增强以监督规则重排与标识符重映射下的一致性。 数据集含10,939条训练样本与1,000条测试样本,策略规则数覆盖1至100条;每条样本配有整体分析与按策略顺序排列的完整违规规则标识列表,无违规则以NR表示;测试集在监督训练、强化学习与检查点选择中均被排除。

提出SafePO强化学习算法,用结构化奖励与价值引导的token加权来优化违规识别。 二值合规奖励无法区分完整判定与漏报部分规则的判定,SafePO改为分别评估预测违规集合与其序列化顺序,对完全匹配给满分,区分顺序错误与规则预测错误,并用集合重叠与序列一致性给部分匹配打分;同时对格式错误与策略外标识符施加惩罚。 算法对每个策略与交互采样一组回复,按组均值与组标准差计算响应级优势;由独立训练的价值模型在分析与判定区域内调整token权重,同时保持各区域总权重固定,使较短的判定区获得既定比例的学习信号;采用裁剪策略更新与对冻结监督模型的KL正则。

训练出0.6B、4B、8B三档AdaGuard模型,在推理时接受用户提供的策略并输出整体分析与违规规则判定。 与主要面向对话合规与内容安全的既有自适应护栏相比,该工作把评估对象扩展到工具介导的智能体行为,要求联合解读策略与轨迹,并返回完整的违规规则集合而非仅二值判断。 4B模型在AdaptiveSafety上二分类准确率89.30%、DynaBench上71.82%;8B模型在AdaptiveSafety上准确率89.50%、二值F1为88.67%,在77.10%的样本中识别出完整规则集、规则micro-F1为74.05%;在DynaBench上8B准确率76.80%、F1为76.05%、规则精确匹配70.72%。

在策略长度与评估范围上给出分层结果,并报告训练阶段对比。 结果按策略长度分组、按用户请求与轨迹两类评估范围拆分,并比较保存的SFT检查点与SafePO检查点,而非只报告单一总体分数。 在51至100条规则的策略上,8B模型准确率88.40%、精确匹配77.20%;AdaptiveSafety中117条用户请求与883条轨迹被分开评估,4B在请求上准确率91.45%、在轨迹上89.01%;8B从SFT到SafePO在AdaptiveSafety准确率由88.40%升至89.50%、DynaBench准确率由74.77%升至76.80%,但4B与0.6B的部分指标出现下降。

启示与展望

该工作面向需要在推理时按用户自定义策略审查智能体行为的部署场景,适用于策略以自然语言规则列表给出、交互记录包含用户请求、智能体消息与动作以及工具返回结果的情形;数据集与模型覆盖1至100条规则的策略,并区分用户请求与轨迹两类评估范围。对希望获得规则级归因而非仅二值判断的开发者,AdaGuard提供整体分析加违规规则标识的输出形式,且推理时只需actor模型。作者指出,部署时应保留对重大决策的人工复核,并针对目标应用的策略重新评估性能。

所有报告结果均为单次运行,作者未给出显著性检验或训练种子波动估计;分析文本的事实正确性未被独立验证,奖励只衡量判定正确性与输出结构。SFT与SafePO的对比属于跨保存检查点的描述性证据,历史评估器的输入预算计算与当前不同,且缺少隔离奖励项、价值调制与区域预算的组件消融。DynaBench上AdaGuard-8B在准确率与F1上仍低于DynaGuard-8B,API模型Jev与GPT-5.2在该数据集上也有更高成绩,且各模型接口与推理预算不同。策略长度分组的内容与标签构成不同,精确匹配并非随策略长度单调变化。这些范围与开放问题提示:哪些训练选择真正带来增益、以及护栏在目标应用策略下能否可靠支持干预,仍有待受控实验与更广泛的部署研究。

来源