跳到主要内容
返回时间线
arXiv来源发表:

南科大与港城大提出Box2-Bench:前沿模型用得上好工作流,却在坏工作流下最多掉43.3分

核心概要

作者提出Box2-Bench,在固定模型与任务的前提下只改变工作流的可用性与可靠性(无、好、坏、部分、混合五种匹配条件),发现Gemini 3.7 Flash、DeepSeek V4 Flash、GLM 5.2等前沿模型在12个模型–任务对中8对受益于好工作流、12对全部被坏工作流拉低(降幅3.3至43.3分),且混合条件在12对中10对低于匹配的部分条件;随后仅用坏工作流训练两个开放权重模型,反事实SFT把坏工作流惩罚从20.0分降到6.7分(AIME)和从9.8分降到0.6分(WebShop),但削弱了对留出好工作流的利用,结果奖励RL又把AIME上的利用率从-3.3恢复到+6.7,并在多智能体协作

AI-generated editorial illustration: Thinking Outside the Box: Can Language Models Rely on External Guidance Selectively?

深度剖析

论文把“能从有用指导中获益、又能推翻不可靠指导”定义为thinking outside the box,并用Box2-Bench把它与任务能力分开测量:任务、环境、评测器与模型固定,只改变工作流条件。 既有基准测自主完成任务或对规定流程的遵从,但不隔离“指导可靠性变化时模型是否调整依赖程度”;Box2用Good、Bad、Partial、Mixed与无工作流五种匹配条件,把利用率、鲁棒性、指导停止后的恢复、指导转为误导后的恢复拆成四个配对效应。 工作流由固定外部模型生成、独立验证器检查有用性、误导性与答案泄漏后冻结,并在所有目标模型间共享;前沿评测覆盖数学、软件工程、信息检索与工具使用四类任务。

结果显示“会用指导”和“能拒绝指导”是两种不同能力:好工作流在12个前沿模型–任务对中8对提升成绩(AutomationBench上分别提升5.9、13.7、16.8分),坏工作流在12对中全部拉低成绩,降幅从3.3到43.3分。 这一分离说明任务表现本身不反映模型对指导可靠性的调节能力,且开放权重模型呈现同样格局:好工作流提升全部6对,坏工作流损害6对中的5对。 配对比较固定任务、环境、评测器与模型,只改变工作流;AIME 2026每题采样8次取多数投票,WebShop为500个官方测试任务的单次完整回合。

依赖具有惯性:混合工作流(有用前缀后接误导后缀)在12个前沿模型–任务对中10对低于共享同一有用前缀的部分工作流,说明模型往往沿用最初有用工作流建立的依赖,而不是在可靠性变化时修正。 由于Partial与Mixed共享有用前缀与变化点,二者之差隔离出“继续跟随误导指导”而非“不再获得指导”的效应,这是任务准确率无法呈现的维度。 该比较在冻结工作流与相同任务标识下进行,并在开放权重模型上重现,构成训练实验的动机。

只用坏工作流训练可以提升鲁棒性,但需要两个阶段才能兼顾利用:反事实SFT把AIME的坏工作流惩罚从20.0分降到6.7分、WebShop从9.8分降到0.6分,同时削弱留出好工作流的利用;随后结果奖励RL在AIME上把利用率从-3.3恢复到+6.7,并保留相对基座的鲁棒性改善。 论文指出SFT损失无法唯一确定选择性依赖——选择性拒绝与一概忽略工作流都能拟合训练数据,因此保留利用率只能来自泛化;结果奖励RL不偏向某条已验证轨迹,允许模型自行发现替代方案。 训练只用坏工作流,好工作流留作评测;AIME用Qwen3-4B、WebShop用Qwen3.5-9B,训练与评测任务分离,AIME评测覆盖全部30题、WebShop覆盖500个官方测试任务。

启示与展望

该结果面向在智能体框架中接收外部程序性指导的模型开发者与评测者:Box2-Bench适用于任务、环境、评测器固定而工作流可靠性可控的设定,可用于诊断模型在指导变坏或中途失效时的行为,并可作为仅用坏工作流做鲁棒性训练、把好工作流留作评测的训练配方。作者指出,工作流由固定外部模型作为人类设计者的可扩展代理生成,未来应评估由人撰写、意图与错误模式更多样的指导;Box2通过受控且冻结的工作流改变可靠性,交互式、模糊、部分正确与随模型自适应的工作流留待后续研究。迁移证据来自多智能体协作与记忆增强推理,作者将其表述为初步证据。

读者仍需留意:工作流由固定外部模型生成并经模型化语义审核,作者说明该审核不报告标注者间一致性系数或候选拒绝率,也不估计人类撰写工作流中此类错误的出现频率;因此基准评估的是一组受控且合理的程序性错误,而非其普遍程度。训练结论基于AIME 2026上的Qwen3-4B与WebShop上的Qwen3.5-9B,SFT与RL的取舍在不同任务上并不一致,WebShop上SFT建立的平衡在RL后大体稳定。迁移结果中,多智能体协作的回合成功率在SFT后由18.00%升至22.67%、SFT+RL为18.67%,作者也指出增益并非跨训练阶段单调;记忆增强推理的分数被作者说明为基于LongMemEval-V2-Small的迁移评估,不与官方榜单协议直接可比。此外,本证据包为全文,但表格与图以文本形式呈现,个别数值的图形细节无法从文本核对。

来源