ToolRACER 用三智能体仿真加四重校验生成 5.6K 条含 66% 失败场景的对话轨迹,微调后使 Qwen3-4B 在 τ-bench 宏观通过率升至 39.20%
核心概要
作者提出 ToolRACER,一个由用户、助手、工具三个仿真智能体组成的三阶段合成数据流水线,通过注入用户侧与环境侧对抗行为并经四重校验与精炼循环,构建了覆盖六个领域、55 种人格、5.6K 条轨迹且约 66% 为失败易发场景的 ToolRACERBench;在该数据上微调的小模型在 τ-bench、BFCLv3 与 ACEBench 上取得优于基线训练集的端到端表现。
Figure 1: Examples of ToolRACERBench conversation trajectories: (a) an Unhappy path and (b) an Impossible path.
arXiv深度剖析
ToolRACER 把鲁棒性显式编码进数据生成过程:助手、用户、工具三个 LLM 智能体各自维护独立对话视图,由中央 runner 编排轮次,并按 Happy(非对抗用户、任务可完成)、Unhappy(对抗用户、任务可完成)、Impossible(任务不可完成)三类骨架场景生成轨迹。 此前多智能体仿真训练数据(如 APIGen-MT)主要覆盖成功、合作的交互,用户侧对抗与工具侧失败被系统性低估;本文把用户发起与环境发起的失败同时建模为可分类的轨迹类型。 论文给出三类路径的完整定义与注入行为清单(部分信息、增量约束揭示、目标修订、对抗态度;后端失败、空结果、超时、策略约束),并在表 1 中按领域与路径给出训练 3,762 条、测试 1,881 条的分布。
四重自动校验(语法、忠实性、角色混淆、任务成功)加精炼循环显著提高可用数据产出:无反馈时仅 26.3% 的仿真通过校验,精炼循环可挽回 65.4% 的初始失败对话。 把 LLM-as-a-judge 的失败原因转化为精炼提示并回灌仿真,而不是丢弃失败轨迹或从头重生成,从而在同等生成预算下提高合格轨迹产量。 附录 A 表 6 给出分路径成功率(Happy 32.2%、Unhappy 23.9%、Impossible 23.6%)与挽回率(72.6%、62.3%、75.0%),Unhappy 路径最难修复。
在 ToolRACERBench 上微调可提升小模型的端到端智能体准确率与跨域泛化:Qwen3-4B-Instruct 微调后 τ-bench 宏观 Pass@1 达 39.20%,与 APIGen-MT 混合后在 retail 域达 52.5%、宏观 41.25%。 相比仅用 APIGen-MT(宏观 36.95%)或开源函数调用模型(ToolACE-MT 20.60%、xLAM-2-3B-FC-R 38.20%),本文用更小的语料(3.7K 对 5K)取得更高或相当的成绩,说明失败易发轨迹本身携带可迁移的训练信号。 表 3 报告 BFCLv3 单轮与幻觉子项、τ-bench airline/retail 的 Pass@1;表 5 报告 ACEBench 上 Qwen3-4B 端到端准确率由 8.4% 升至 10.0%,Qwen2.5-32B 由 19.2% 升至 25.0%。
数据质量对比显示 ToolRACERBench 在多样性上占优而在对话长度上更短:每对话工具数 11.8、轮数 12.6,低于 APIGen-MT-5k 的 15.1 与 18.5,但熵 9.29、Distinct-3 0.348、对话 Vendi 23.8、工具轨迹 Vendi 18.8 均更高。 说明鲁棒性增益并非来自更长的对话或更多工具调用,而来自人格与失败注入带来的轨迹分布多样性。 表 2 按 Wang et al. (2025c) 的指标比较两个语料,ToolRACERBench 在六项自动评估中五项更高;唯一更低的蕴含率为 0.042 对 0.071,作者将其解释为真实用户对话本身更易变。
启示与展望
该资源面向需要训练或评测工具调用对话智能体的研究者与工程团队,适用于多轮、含函数调用、且用户行为与工具环境可能偏离理想路径的场景。三类路径的划分与注入行为清单可直接用于构造领域内骨架场景;精炼循环的失败原因回灌机制可用于在有限生成预算下提高合格轨迹产量。跨域结果提示,把失败易发轨迹与领域内数据混合,是在小模型上兼顾鲁棒性与任务性能的可行配置。
读者仍需关注:合成轨迹与真实用户分布的差距如何影响下游部署;ACEBench 上端到端准确率提升而过程准确率下降,长程多轮任务的改进路径尚不明确;蕴含率低于对照语料这一现象,作者给出的是解释性说明而非受控实验;不同基座模型与更大规模下的增益是否保持,文本未给出结论。若后续版本补充图表细节,可进一步核对各消融组合的稳定性。
