跳到主要内容
返回时间线
arXiv来源发表:

BlindBias 仅凭采样文本在四个黑盒端点实现解码期越狱,24 项对比中 20 项取得最高均分

核心概要

该工作提出 BlindBias 框架,在只返回采样文本、允许重复采样与助手前缀续写的接口上做解码期越狱:用基于采样的分布重建、风险门控残差控制与投机多 token 执行三项组件,在四个目标端点与三个基准上于 24 项对比中的 20 项取得最高均分,并显示选择性干预以攻击效果换取更少的控制器调用。

AI-generated editorial illustration: Controlled Decoding Attacks on Black-Box LLMs

深度剖析

BlindBias 把解码期残差控制从需要权重或数值概率的设定,迁移到只返回采样文本的接口,并在四个目标端点(GLM-5、Gemini-3.5-Flash、Qwen3-32B、Kimi-K2.5)与三个基准(AdvBench、HarmBench、SORRY-Bench)上于 24 项对比中的 20 项取得最高均分。 此前的解码期攻击依赖目标权重或数值 token 概率,而黑盒越狱主要停留在提示搜索、模板演化、多轮交互或编码指令层面;该工作把 BiasNet 残差控制器适配到采样文本接口,保留细粒度控制。 主表给出四个目标、三个基准、两个指标(Harm 与 Info)的逐项分数,并与 PAIR、GPTFuzz、LogiBreak、FlipAttack 四个官方实现基线对比;增益并非普遍,例如 GLM-5 的 SORRY-Bench 上 FlipAttack 在两个指标上领先。

样本重建把有限采样得到的稀疏计数与先验结合,恢复出可用的控制信号:均匀先验把 PPL 从 11.85 降到 7.07,并把 Harm/Info 从 1.50/1.26 提升到 3.03/2.16。 该工作说明在只有采样文本时,重建质量与转向效用相关但并不等同:全局 unigram 先验预测拟合更好,攻击分数却低于均匀先验;数值对数概率仍是更强的参照(PPL 3.17,Harm 4.06)。 消融在 40 条训练缓存与 100 条留出 AdvBench 提示、Qwen3-32B 目标上进行,报告 PPL、未见事件 NLL 与下游攻击分数;数值概率参照被明确标注为采样设定之外。

风险门控把重建与干预集中在少数位置:软门控相对无门控把平均 API 调用从 4000 降到 283(92.9%),Harm 从 3.96 降到 3.58;相对硬门控,活跃位置从 9.5% 降到 5.25%,API 调用减少 36.8%。 该工作用随响应前缀演化的风险分数决定何时重建与修改分布,而不是只在固定的开头窗口干预,从而在生成后段仍可重新激活控制。 门控对比在 Gemini-3.5-Flash 上给出 Harm、Info、API 调用与活跃位置比例;文中同时指出活跃位置比例本身不能确定端点级查询节省,后者还取决于采样、重试与响应长度。

投机多 token 执行与上下文先验迁移构成两项扩展:前者在被门控抑制的区段用草稿—验证摊薄目标调用,后者显示同族代理先验在 PPL、Harm、Info 三项上均最好,跨族代理相对打乱先验仍能提升 Harm。 投机路径借用投机解码的草稿—验证结构,但由本地风险模型验证前缀是否可绕过控制器;先验迁移则检验在目标词表不可得时用代理先验提供控制信号的可能性。 先验迁移固定 Qwen3-32B 目标与控制器,比较 Qwen3-1.7B、SmolLM2-1.7B、Gemma-3-1B 与打乱先验;文中说明验证只对已接受前缀执行门控规则,并不保证与逐 token 调用等价。

启示与展望

该框架面向允许重复随机采样与助手前缀续写的纯文本续写接口,攻击者不能访问目标权重、隐藏状态或数值 token 概率;主设定用本地分词器定义动作词表,并为每个目标单独训练控制器。在这一设定下,结果适用于四个被评估端点与三个英文有害请求基准,可用于评估此类接口的解码期风险,并为进一步降低端点级查询成本、把可靠控制扩展到非分词器动作空间提供起点。

重建质量与转向效用并不一致:全局 unigram 先验预测拟合更好但攻击分数低于均匀先验,数值对数概率仍是更强参照,因此采样信号的上限仍待刻画。门控的活跃位置比例不等于端点级查询节省,后者还受采样、重试与响应长度影响。投机路径的验证只对已接受前缀执行门控规则,文中明确不保证与逐 token 调用等价。词表无关的字符串动作空间受限于校准中未出现的 token 串无法生成,且代理先验只保留首个 token,属于探索性压力测试。此外,训练使用参考前缀而推理使用生成前缀,这一前缀分布差异在文中被点明为尚未消除的差别。

来源