跳到主要内容
返回时间线
arXiv来源发表:

GlitchPatch 在冻结语言模型上以局部重分词修复故障词元,十个模型平均修复率 85.10%、回归率 0.00%

相关研究与后续进展

核心概要

该工作提出 GlitchPatch,一种不访问模型内部、仅通过优化输入分词来修复故障词元的外部框架:离线阶段用行为路径优化(BPO)为每个故障词元搜索行为最优的等价替换词元序列并编译成规则表,在线阶段只替换规范词元序列中匹配到的故障词元 ID;在覆盖六个分词器家族的十个模型上,平均修复率 85.10%,比最强基线高 14.37 个百分点,平均故障率从 14.88% 降至 2.27%,全词表评估回归率 0.00%,平均在线延迟增幅低于 0.1%。

Source-provided article image: GlitchPatch: Repairing Glitch Tokens in Frozen Language Models via Local Retokenization
Figure 2 ·

Figure 2: BPE tokenization of “Hello!” with Qwen3.8-27B.

arXiv

深度剖析

首次探索从模型外部修复故障词元,并通过 BPE 合并规则删除的实证研究揭示两条规律:删除故障词元的合并规则能修复一部分失败,但会破坏共享中间合并节点的正常长词元,使整体故障率上升;不同分解粒度给出的修复率随模型非单调变化,而对正常词元的附带损害随深度单调增长。 此前 GlitchProber、GlitchEdit、GlitchCleaner 等修复方法都必须在模型内部进行(激活钩子、嵌入权重编辑或门控 LoRA 分支),该工作把修复问题重新表述为输入分词层面的优化,并指出全局规则删除无法同时兼顾修复率与正常词元保护。 在 Llama-3.1-8B-Instruct 与 Qwen3.8-27B 上对全部词表逐词元运行重复、拼写、长度三项 GlitchQuiz 任务,按三种回溯深度全局删除合并规则后重新编码并复测,报告修复率、回归率与故障率随深度的变化。

提出 GlitchPatch 框架:离线用 BPO 在候选等价路径图上以代理分数排序、对前若干条路径做全上下文评估并经独立校准确认规则;在线只做单次规则匹配与 ID 替换,不改动模型参数或内部状态,未匹配输入按构造保持不变。 把修复从内部干预转为可逆的输入级补丁,规则表只记录故障词元 ID 及其替换序列,因此正常词元编码完全不变;同时用代理分数加全路径验证在候选路径众多、穷举评估不可行的情况下控制成本。 给出解码等价约束、候选图构造、效用函数与阈值设定,并用消融验证各组件:仅限 BPE 合并历史使修复率降至 73.82%,去掉相邻对项降至 81.73%,去掉全路径验证降至 85.34%,降低效用阈值升至 90.23% 但行为稳定性下降。

在十个模型、六个分词器家族上,GlitchPatch 平均修复率 85.10%,逐模型均高于全部基线,平均故障率由 14.88% 降至 2.27%,全词表评估回归率 0.00%;实用性上平均离线构建 0.89 小时、在线延迟增幅约 0.065%,含故障词元自然文本的词元级损失平均相对下降 13.47%,四个通用基准的 General Score 平均变化 0.008 个百分点。 相对需要模型内部访问的基线(GlitchCleaner 70.73%、GlitchEdit 58.39%、GlitchProber 24.63%),该方法在更严格的输入级限制下取得更高修复率,且构建时间更短、无额外参数与额外模型调用。 全词表逐词元检测消除选择偏差;上下文回归中相邻正常词元短答准确率变化不超过 0.2 个百分点;分布外下游任务(实体问答、逐字复制、代码标识符补全)在统一均匀抽样的 500 个故障词元上平均准确率 70.0%,高于 GlitchCleaner 59.5%、GlitchEdit 53.5%、GlitchProber 48.3%。

刻画可修复性边界:Qwen3.8-27B 的 29,451 个故障词元中 5.00% 因词表中不存在预算可行的等价路径而结构性不可修复,可用路径数与修复率正相关(1–3 条路径 85.4%,4–10 条 93.8%,50 条以上 98.7%),在存在可行路径且初始探针不全失败的子集上最终修复率为 92.21%。 把修复率差异归因到词表结构与路径可用性,而非仅报告总体数字,为判断哪些故障词元值得修复提供了可操作的依据。 按可用路径数对全部故障词元分组统计修复率,并列出无可行路径、效用不足、校准失败、最终评估失败等保留与失败情形及其占比。

启示与展望

该结果面向部署冻结检查点、希望在不改动权重与推理实现的前提下快速可逆修复故障词元的提供方与工程团队,适用于分词器满足其适配契约(字节级 BPE 或 SentencePiece,含归一化、前导空格、字节回退与特殊词元处理)的模型。方法以逐词元行为测试(重复、拼写、长度)判定故障,并以解码等价为约束,因此其修复范围限于词表中存在预算可行等价路径的故障词元;规则表按模型与分词器构建,离线构建时间在 0.36 至 2.08 小时之间,在线仅增加规则匹配与序列重建。

仍需观察的是:故障判定依赖重复、拼写、长度三类行为任务,其他形式的异常行为是否同样被覆盖尚待检验;修复率在不同词表规模与分词器家族间存在差异(80.50% 至 91.04%),结构性不可修复词元占比约 5%,这部分词元需要其他途径;规则表与超参数在 Qwen3.8-27B 开发集上选定后固定用于其余模型,跨模型迁移的稳健性值得继续跟踪;语言理解与上下文评估使用 GPT-5.6-Terra 生成含目标词元的文本,其生成分布对结论的影响是一个开放问题;实体问答由模型判定相关性,虽报告了 50 样本上 94% 的判定一致性,人工核验规模仍有限。

来源