TraceDance 从 252,557 条真实部署轨迹自动生成 107 个行为基准,九个前沿模型平均通过率仅 26.7%
核心概要
TraceDance 是一个从真实部署轨迹中为用户指定的不良行为自动构建定向基准的智能体系统,它用 Anchor-and-Confirm(可编程检索加 Flash 大模型候选级确认)和 Anchor Synthesis Loop 生成行为规范,用决策点续写方式让被测模型在记录下来的决策点生成下一轮回复并由行为专属评分表打分;实验基于 Claude Code 与 OpenClaw 的 252,557 条会话,产出 107 个基准、4,125 个实例,满足 95.3% 的构建请求,两名标注者在 84% 的抽样实例中确认了目标行为,九个前沿模型平均通过率仅 26.7%。
深度剖析
TraceDance 把部署轨迹转成按需构建的行为基准:用户用自然语言描述一种不良行为,系统返回包含确认发生该行为的上下文输入和行为专属评分表的基准,或在无法满足时给出拒绝理由。 此前的任务完成度基准(如 Terminal-Bench 检查最终容器状态)与安全/过程级套件都使用固定的测试用例和目标行为,审计工具则只识别轨迹中的不良行为而不把它们转成可复用的测试;论文称 TraceDance 是首个把这一思路变成面向用户指定不良行为的按需基准的系统。 系统输入输出契约、三类决策帧(action、failure、claim)的切分规则和实例有效性三条件在正文第 3 节给出;实验在 139 条测试查询上验证,其中 107 条为预期构建、32 条为预期拒绝。
Anchor-and-Confirm 用 CPU 上的可编程锚点做广扫、只用 Flash 大模型复核候选,把构建成本压到可承受范围;Anchor Synthesis Loop 在预定义规范不匹配时合成、校验并修订自定义规范。 逐条会话交给大模型或人工审阅在部署规模上成本过高,论文把“广扫”和“语义确认”分离,并让锚点作为可执行代码先过程序化安全检查与 Reviewer 模型代码审查,再用检索质量统计(确认率、候选数量)驱动修订。 成功查询平均扫描 128,297 条会话、向 Fast Model 送审 706 个候选、最终平均产出 40.4 个实例,全流程平均 552 次大模型调用,而拒绝类对抗查询平均仅 1.3 次;附录 A.2 给出轮次预算与检索质量阈值,并给出一个锚点修订使匹配会话从 3 增至 32 的例子。
决策点续写让评测不需要参考答案、也不需要重放环境:实例是被测模型在记录上下文中的下一轮回复,由行为专属评分表按 0–5 分打分,三名大模型评委取均值、均值不低于 4 记为通过。 这使来自私有仓库、内部工具、MCP 服务器等无法复现环境的真实轨迹也能用于评测,且所有被测模型看到完全相同的记录上下文;论文提到 OpenAI 的生产评测已在部署对话上重生成回复,而 TraceDance 把它做成面向用户指定不良行为的按需基准。 评分表质量在 100 个抽样实例中有 90% 被两名标注者评为至少 4/5,平均 4.75/5;在两名标注者都确认并打分的 84 个实例上,评委组与人类的通过/不通过一致率为 81.0%,与标注者之间的一致率相当,评委组的 Cohen's κ 为 0.40,高于标注者之间的 0.31。
基准揭示出任务完成度评测看不到的行为短板:九个前沿模型平均通过率 26.7%(区间 22.9%–33.5%),按评分表要求分组后,Valid call 平均 67.9%,而 Check first 仅 8.1%。 论文报告 GPT-5.6-Sol 在 SWE-bench Pro、Terminal-Bench 2.1 等任务型基准上得分高于 DeepSeek-V4-Pro 和 GLM-5.2,但在这些行为基准上并未超过二者;总体排名也会掩盖单项强弱,例如 Claude Opus 4.8 总体第一,却在 Error-guided correction 上以 27.8% 落后于 Kimi-K3 的 57.8%。 表 2 给出九个模型在总体、三种帧和两种部署设置下的通过率;图 4a 的分组基于 102 个单行为基准、3,966 个实例,且论文报告在多种通过规则和单个评委下四组排序不变;具体行为上 Secret protection 平均 6.9%、Commit hygiene 0.9%、Failure-log inspection 0.6%。
启示与展望
这套方法面向智能体开发者:当开发者手上有真实部署轨迹、并能用自然语言描述想要测试的不良行为时,TraceDance 可以按需产出定向基准,用于比较模型、指导改进和检测回归。它适用于编码与通用工具使用两类部署设置,也适用于依赖私有仓库、内部工具、MCP 服务器或外部服务账号等无法重放的环境,因为评测只使用记录下来的决策点前上下文。论文把 TraceDance 定位为递归自我改进循环中的评测组件,并明确把“在该循环中评估 TraceDance”留给未来工作。
评测只覆盖被测模型在记录决策点上的下一轮回复,不执行动作、不继续轨迹,因此无法观察这一轮之后会发生什么:一个先做规划或先收集信息的回复可能后续表现恰当,而一个通过的回复在执行时仍可能失败。实例都切自源模型已经表现出目标行为的上下文,所以通过率描述的是“行为在实践中已经发生过的决策点”上的表现,而不是该行为在部署中的发生频率。评分表只给最恰当的回复记通过,避免不良行为但未满足完整评分表的回复仍可能不通过,因此绝对通过率依赖通过规则;论文报告在替代通过规则和单个评委下相对排序保持稳定。构建与评分本身也不完美:两名标注者在 84% 的抽样实例中确认目标行为,评委组打分比人类更宽松,且 GPT-5.6-Sol 作为评委对自身回复表现出约 0.22 分(0–5 分制)的相对偏好。此外,本次读取的文本包含正文与附录,但部分表格中的数值在文本中未完整呈现,涉及这些单元格的具体数字无法在此复述。
