跳到主要内容
返回时间线
arXiv来源发表:

ReCast 将冻结 LLM 隐状态转为归因导向步骤表示,在四个失败归因基准上取得最高 Hit@1

核心概要

该工作先量化发现文本嵌入与隐状态对根因步骤的区分度有限,随后提出 ReCast:用归因感知探针选层、稀疏 Johnson–Lindenstrauss 投影构造模式与偏差双分支特征,再用对比与排序目标训练双向编码器,把冻结 LLM 隐状态转成归因导向步骤表示,并发布 ReCast-2K 训练集;在 Who&When、TraceElephant、AFTraj-2K、Who&When Pro 四个基准上 Hit@1 均最高。

Source-provided article image: ReCast: Attribution-Oriented Step Representation Learning for LLM-Based Agent Systems
Figure 1 ·

Figure 1: Comparison of text embeddings and last-layer hidden-state representations on failed trajectories from ReCast-2K and the Handcrafted and Algorithm subsets of Who&When. Lower ARS/GRS and higher SI indicate better separation. See Appendix A for metric definitions.

arXiv

深度剖析

论文先用 ARS、GRS 与余弦 Silhouette Index 三项指标量化评估 Qwen3 文本嵌入与 Qwen3.5-27B 末层隐状态,发现这些表示对根因步骤的区分度有限:同轨迹内根因与其前一步及其他步骤相似度高,跨轨迹分离度低。 此前工作多直接沿用文本嵌入或隐状态作为步骤表示,未系统检验其归因判别力;该工作把“哪种步骤表示适合失败归因”作为可量化问题提出,并给出轨迹内与跨轨迹两类分离度量。 在训练集失败轨迹以及 Who&When 的 Handcrafted 与 Algorithm 子集上比较三种基础表示,指标定义与表示细节见附录 A;结论为“有限分离”,未报告单一显著性检验。

ReCast 由三部分组成:归因感知探针按区分根因能力选层并保证深度覆盖;固定稀疏 Johnson–Lindenstrauss 投影生成模式分支与以成功轨迹均值为参照的偏差分支;双向编码器在根因对比损失、非根因对比损失与轨迹级排序损失联合训练下输出上下文步骤表示。 相较直接对内部信号打分(如 MASPrism 的 NLL 与注意力)或建模成功动态(如 OAT),ReCast 不直接评分原始信号,而是学习面向归因的步骤表示;相较仅用外部轨迹表示的方法,它利用冻结 LLM 的内部信号。 消融显示完整模型平均 Hit@1 最高,归因感知选层比五种替代方案高 2.75–4.40 个百分点,联合损失比仅排序训练高 3.85 个百分点,去掉数据增强下降 4.22 个百分点;投影分支、编码器与非根因锚点选择的消融也均低于完整模型。

在四个基准上 ReCast 的 Hit@1 均最高:Who&When Algorithm 与 Handcrafted 分别超过次优方法 CHIEF 5.65 与 9.19 个百分点;TraceElephant 的 Captain-Agent 与 Magentic-One 分别超过 ASCon 4.71 与 1.11 个百分点;AFTraj-2K 与 Who&When Pro 上分别超过 ASCon 1.02 与 8.71 个百分点。 这些提升出现在不同训练数据设定下(Who&When 与 TraceElephant 用 ReCast-2K,AFTraj-2K 用其官方训练划分,Who&When Pro 用其训练分区),说明收益不限于自建数据集。 所有方法使用相同三个种子并报告均值与标准差;AgenTracer-8B 因未公开仅引用其报告值,无多种子结果。

学习到的步骤表示在同一批指标上取得更低 ARS 与 GRS、更高 SI,说明轨迹内与跨轨迹分离度均改善;同时 ReCast 在预计算特征下归因阶段平均耗时 0.11–8.28 毫秒/轨迹,而所测 LLM 基线需 2.88–30.50 秒/轨迹。 这既回应了开篇观察到的表示分离不足,也表明归因阶段可在特征预计算后高效运行,与依赖自回归解码的 LLM 方法形成对照。 表示分离对比覆盖训练集、Handcrafted 与 Algorithm;效率对比在 Who&When 与 TraceElephant 上按每轨迹平均时间统计,特征提取与缓存准备时间被排除在归因时间之外。

启示与展望

该结果面向以模型生成动作为候选步骤的多智能体执行轨迹:候选集排除环境观测与工具结果消息,因此工具输出本身被标注为决定性错误的轨迹不在评估范围内(Who&When 中两条此类 AG 轨迹被剔除)。方法适用于可获取冻结 LLM 隐状态的场景,归因阶段在特征预计算后为毫秒级,适合需要快速定位根因的调试与在线审计流程;训练侧需要带根因标注的失败轨迹,论文以 ReCast-2K 及基准自带训练划分提供。骨干规模收益随基准而异,27B 在 Who&When、AFTraj-2K 与 Who&When Pro 上 Hit@1 最高,而 0.8B 与 9B 分别在 Captain-Agent 与 Magentic-One 上最高,因此部署时可依目标基准选择骨干。

根因标签的构造方式影响可迁移性:ReCast-2K 的标签来自三个 LLM 评委的步骤级投票(766 条一致、346 条两票多数)加 384 条人工复核,而 Who&When Pro 采用受控错误注入以获得因果标签,两类标签语义不完全相同。表示分离指标(ARS、GRS、SI)与 Hit@1 之间的关系在文中以一致性方式呈现,但未给出指标改善到准确率提升的定量映射。骨干规模与准确率并非单调,较小骨干在部分子集领先,说明收益依赖基准与指标。此外,正文中若干数值(如部分表格与图 3、图 4 的具体数字)在解析文本中缺失,若需精确复现实验数值应查阅原文表格与附录。

来源