跳到主要内容
返回时间线
arXiv来源发表:

关键词评测把不会调用工具的1B模型判成合格:严格诊断阶梯定位出缺失先验,并用3.3 GPU小时修复

核心概要

该工作在一对共享解码器、分词器与特殊token布局的西班牙语安全小模型(VectraYX-600M 661.6M参数、VectraYX-1B 1,109M参数)上发现关键词式工具使用评测的假阳性:两者在宽松指标B4上几乎相同(0.660对0.650),但逐字复现检查显示600M在6/6训练样例上生成带泛化参数的合法工具调用,1B在所有修复前检查点上为0/4–6,首token探针把失败定位为<|tool_call|>上约10^-4–10^-5的缺失先验,随后一个多样语料、5倍学习率、2,202步、约3.3 GPU小时的定向SFT把1B的合法生成率从0.100提升到0.959,并在238条未见实体提示上

AI-generated editorial illustration: Keyword Harnesses Fail Open: A Cheap Diagnostic Ladder for Tool-Use Claims in Small Language Models

深度剖析

关键词匹配式评测会把只在散文中提到工具名、却从未生成结构化调用的模型判为具备工具使用能力。 此前该系列已在Nano模型的B2分类指标上记录过同类过度给分,本文把同一失效类别复现到B4工具使用指标上,并给出可复用的严格替代检查。 两个模型在B4上相差0.01(0.660对0.650),而逐字复现检查在最大有利条件下把二者完全分开(6/6对0/4–6);作者据此判定1B的B4不可用,并保留600M的B4,因为其宽松与严格两种仪器结论一致。

工具调用能力是否默认出现,与预训练语料构成相关:代码占比高的单阶段预训练模型默认就会发出结构化调用,而网络文本为主、且带有专门6B token工具SFT阶段的更大模型反而不会。 该对比把该系列此前关于“引导语料语域主导下游行为”的结论从对话语域推进到结构化输出,并指出语料构成决定能力是“免费获得”还是“必须工程化补上”。 两者共享解码器实现、32K分词器与特殊token布局,但参数量(1.68倍)、总token量与课程形状不同,作者明确称其为自然实验而非消融;600M在计划进度64%处冻结、无专门SFT,仍默认出现该能力。

失败可被定位为缺失先验而非噪声先验,并可用远少于失败阶段的token量修复。 失败的专门SFT阶段用了6B token,而成功的定向配方只用约三个数量级更少的token、2,202步、约3.3 GPU小时,说明token量对结果没有预测力,配方才是决定因素。 首token探针在<|tool_call|>上给出约10^-4–10^-5的概率;修复后全部269条语料行合法生成率由0.100升至0.959(600M为0.926),238条未见实体提示上0.536对0.428(配对p=0.004)。

修复改变的是网络的路由而非触发token的表示。 该检查排除了“嵌入损坏”这一自然假设,并因输入输出嵌入绑定而同时覆盖了网络需要瞄准的几何目标方向。 <|tool_call|>嵌入行余弦相似度约0.999996、行范数变化极小,与20个普通token行基线相当;97.7%的bf16嵌入表逐位相同,而第20–21层注意力投影出现可测漂移,构成阳性对照。

启示与展望

该结果面向在有限算力下构建亚十亿参数工具调用模型的团队:把输出格式纳入预训练语料构成的一等设计变量,把首token探针作为近乎免费的训练期遥测,并在引用任何工具使用基准分数前先跑严格结构检查。诊断阶梯本身只需分钟级CPU时间,适用于任何具备存档检查点的模型谱系;修复配方在单个1B检查点上验证,并在同一谱系的复现检查点上重跑,其适用设定是西班牙语安全领域的MCP工具调用场景。

600M训练在计划进度的64%处永久冻结,未完成余弦退火,因此其质量是下界而非成品;匹配对在参数量、总token量与课程形状上并不一致,作者称其为自然实验,语料构成只是领先的幸存解释而非已证因果。严格诊断的样本量小(逐字复现6例、泛化电池8条提示),泛化电池由作者自建而非从外部分布采样,且不覆盖未见工具与多调用序列。修复配方的原始检查点与其热启动父检查点均已丢失,本文所有修复后数字来自端到端复现;配方四个成分中,热启动点与嵌入表已被排除,语料多样性与学习率由五臂因子实验分离,但四个单元中三个只完成一次运行,低学习率下多样性带来的抑制优势未被第二个种子复现,因此仅作为假设保留。两个模型都过度触发,在提及CVE或shell命令但实为概念性提问的近似提示上抑制率很低;修复后的1B在自身语料上多为逐字复述,且未被证明能有用回答普通对话问题。此外,B4系列数值来自与主表不同的评测调用,其差异本身也提示该指标对该模型不可靠。

来源