跳到主要内容
返回时间线
arXiv来源发表:

LiteTrajEval 以预算受限的规则画像与单一评分式 LLM 评审,将智能体轨迹失败定位与人工标注的对齐度提升约 20–35 个百分点,同时把成本降低约 6 倍、评估时间缩短 8 倍以上

相关研究与后续进展

核心概要

该工作提出 LiteTrajEval,一种预算受限的轻量轨迹评估架构:离线导出紧凑的领域专用规则画像,在线对每条轨迹做预处理、标记启发式失败信号、在固定全局预算下序列化,并调用单一评分式 LLM 评审生成结构化诊断报告;在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上,相比 AgentRx,其失败定位与人工标注的对齐度在 Magentic-One 上提升约 20–35 个百分点、在 τ-retail 上最高提升 23 个百分点,同时成本降低约 6 倍、评估时间缩短 8 倍以上,并已部署于其企业智能体平台。

Source-provided article image: Lightweight, Rubric-Guided Trajectory Evaluation for Production AI Agents
Fig. 1 ·

Fig. 1: Overview of the LiteTrajEval pipeline. An offline step (dash line) generates domain-specific rule profiles from accumulated trajectory outputs. The online path processes heterogeneous agent execution logs, serializes trajectories under a fixed budget, and evaluates them with rubric-guided LLM judge.

arXiv

深度剖析

提出 LiteTrajEval,一种面向生产环境的预算受限轨迹评估架构,将评估拆分为离线规则画像导出与在线轨迹预处理、启发式失败信号标记、固定全局预算下的序列化,以及单一评分式 LLM 评审生成结构化诊断报告。 相对于需要反复运行完整轨迹评估的既有做法,该架构把领域专用规则画像的构建移到离线阶段,并在在线阶段以固定全局预算压缩轨迹,从而把评估成本与时间纳入可控范围。 摘要报告该方案在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上完成评估,并已部署于企业智能体平台;具体实现细节与实验配置未在摘要中给出。

在失败定位与人工标注的对齐度上,LiteTrajEval 相比 AgentRx 在 Magentic-One 上提升约 20–35 个百分点,在 τ-retail 上最高提升 23 个百分点。 该结果把评估质量的比较锚定在公开轨迹数据集与人工标注上,并给出与 AgentRx 的对照,而不仅是报告单一系统的绝对表现。 证据来自摘要中报告的公开数据集对比结果;摘要未给出样本规模、标注协议或统计检验细节。

在提升对齐度的同时,LiteTrajEval 将成本降低约 6 倍、评估时间缩短 8 倍以上。 该结果说明预算受限的预处理与单一评审调用可以在不牺牲失败定位对齐度的前提下,同时改善成本与延迟这两个生产环境中的关键约束。 证据为摘要中报告的成本与时间倍数对比;摘要未说明成本口径、硬件环境或时间测量方式。

启示与展望

该工作面向需要反复评估的生产级 LLM 智能体轨迹,适用于轨迹中包含工具调用、观察、重试与外部输出,且诊断价值在原始 token 间分布不均的场景。其设计目标是在固定全局预算下运行,因此适合预算与延迟受限、但仍需结构化诊断报告的团队,例如运营企业智能体平台的工程与运维人员。离线导出的规则画像带有领域专用性,意味着迁移到新领域时需要重新构建画像。摘要提到该方案已部署于企业智能体平台,说明其定位不止于研究基准。

摘要层面未给出样本规模、人工标注协议、统计显著性检验,也未说明成本口径与时间测量方式,因此对齐度提升与成本、时间倍数的稳健性仍需在正文中确认。规则画像的领域专用性意味着跨领域迁移效果尚不明确。此外,摘要提到已部署于企业智能体平台,但未提供部署规模、线上指标或与离线评估的一致性证据。由于本次仅基于摘要,图表与实验细节未纳入,上述问题应视为待正文回答的开放问题。

来源