跳到主要内容
返回时间线
arXiv来源发表:

SAKIKO 审计七个大模型的工具调用干预:行为改变不等于修复,仅 Qwen3-8B 获正式认证

核心概要

该工作提出 SAKIKO 审计框架,把工具调用前的内部激活干预拆成方向性错误发现、路由器条件干预、目的地解析验证与预注册统计许可四个环节,在 When2Call 与 MetaTool 上测试七个大模型,发现五个模型出现方向特异性净增益,但目的地审计显示行为移动不等于修复——一个净增益 +55 的干预破坏了其触及的过半基线正确决策,Qwen3-4B 与 Gemma-2-9B 因有限样本不确定性被正式拒绝,仅 Qwen3-8B 通过全部十项条件获得 ADMIT。

AI-generated editorial illustration: When Does Correction Become Repair? Mechanistic Auditing of Internal Interventions in Tool-Using LLMs

深度剖析

论文把工具调用前的决策错误形式化为 K 路动作空间中的有序方向性错误通道,并指出离开错误状态并不等于到达正确目标。 此前的工具激活干预研究多在二元动作空间(调用/不调用)或成对工具替换中评估,离开错误状态即等于到达正确状态;该工作把评估扩展到四类动作(直接回答、调用 API、请求澄清、拒绝任务),并给出五类互斥结果划分:源保留、命中目标、其他错误、正确保留、被破坏。 在 When2Call 四动作基准上以教师强制打分读取决策,训练/验证/测试划分为 2,556/548/548;Phi-3.5-mini 上 200 个被路由错误中 153 个离开源状态,但只有 107 个到达目标,46 个落入其他错误类。

SAKIKO 将修复拆成可独立失败的五个阶段,并证明聚合净增益会同时掩盖横向错误再分配与对基线正确决策的附带损害。 以往工作以聚合准确率或二元状态退出衡量干预成功;该工作引入目的地解析验证与两个附带损害分母(总体 E1 与暴露条件 E2),显示同一净增益可对应完全不同的目的地构成。 Phi-3.5-mini 上一个净增益 +55 的干预破坏了其路由器触及的 93 个基线正确决策中的 52 个;Qwen3-8B 上内部激活干预与分数空间基线净增益接近(38 对 37 次命中目标),但内部干预仅将 52 次退出中的 14 次误导向其他错误,而分数偏移将 58 次退出中的 21 次误导向其他错误。

预注册的十项条件统计许可把点估计与统计上稳健的修复区分开,两个密封设置因置信区间不达标被正式拒绝。 此前干预研究通常只报告有利的点估计而不附不确定性判据;该工作以冻结的证据层级要求置信区间而非孤立点估计满足阈值,并对照 59 个预算匹配的随机方向做加一蒙特卡洛检验。 Qwen3-8B 通过全部十项条件获得 ADMIT(目标命中率 0.7308,目标增益 0.2759,零破坏);Qwen3-4B 与 Gemma-2-9B 的目标增益置信区间跨越零、目标命中率区间跌破阈值而被 DECLINE;59 个随机方向中无一达到校准方向的目标增益。

线性可解码性不等于可操控性,且路由器门控限制暴露但不保证被触及决策的安全。 该工作显示探针准确率在中间层趋于平台,而下游操控效果急剧下降;注入位点、剂量与干预成功率与探针准确率分离,且门控在不同设置下对净增益的影响方向不一致。 Qwen2.5-7B 第 16 至 22 层线性探针可解码性稳定在约 0.9,而验证净增益从第 16 层的约 0 跃升至第 20 层的约 0.6;移除门控在 Phi-3.5-mini 与 MetaTool 上使净增益转为负值,在 Qwen3-4B 上把破坏数从 1 提高到 6 而命中数保持 37 不变。

启示与展望

该框架面向在冻结权重上做推理时激活干预的研究者与评估者,适用于具有明确金标签、基线错误群体与暴露参考划分的多类动作空间。正式许可结果仅建立在 When2Call 上,MetaTool 用于二元历史证据,ACEBench 在干预前因通道支持不足被退役。唯一获得 ADMIT 的配置是 Qwen3-8B 在 cannot_answer 到 tool_call 通道上的梯度激活干预,该许可仅认证分类动作模式选择,不涉及下游执行有效性,也不构成部署安全声明。

目的地解析结果依赖 When2Call 由基准作者合成生成且未经事后重标注的标签,未建模的系统性标注偏差可能在不触发门控违规的情况下改变目的地分布。暴露条件保持性在本研究所有设置中均未获认证:Qwen3-8B 仅在 6 个被路由正确决策上观察到零破坏,其单侧上界为 1.0,而认证一个 0.05 的界需要至少 59 个暴露正确实例。Qwen3-4B 与 Gemma-2-9B 的拒绝完全由自助法区间条件驱动而非点估计失败,Qwen3.5-9B 的干预前中止在回顾性划分重分配中约 90% 可获资格,说明该中止对划分敏感。激活干预与分数空间比较器之间未建立稳定排序,经多重性校正的配对检验不显著。此外,本证据包为全文解析,若图表细节未完整呈现,可能影响对个别数值的复核。

来源