arXiv 2026年10月5日该工作提出 LiteTrajEval,一种预算受限的轻量轨迹评估架构:离线导出紧凑的领域专用规则画像,在线对每条轨迹做预处理、标记启发式失败信号、在固定全局预算下序列化,并调用单一评分式 LLM 评审生成结构化诊断报告;在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上,相比 AgentRx,其失败定位与人工标注的对齐度在 Magentic-One 上提升约 20–35 个百分点、在 τ-retail 上最高提升 23 个百分点,同时成本降低约 6 倍、评估时间缩短 8 倍以上,并已部署于其企业智能体平台。该工作提出 LiteTrajEval,一种预算受限的轻量轨迹评估架构:离线导出紧凑的领域专用规则画像,在线对每条轨迹做预处理、标记启发式失败信号、在固定全局预算下序列化,并调用单一评分式 LLM 评审生成结构化诊断报告;在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上,相比 AgentRx,其失败定位与人工标注的对齐度在 Magentic-One 上提升约 20–35 个百分点、在 τ-retail 上最高提升 23 个百分点,同时成本降低约 6 倍、评估时间缩短 8 倍以上,并已部署于其企业智能体平台。LiteTrajEval 以预算受限的规则画像与单一评分式 LLM 评审,将智能体轨迹失败定位与人工标注的对齐度提升约 20–35 个百分点,同时把成本降低约 6 倍、评估时间缩短 8 倍以上该工作提出 LiteTrajEval,一种预算受限的轻量轨迹评估架构:离线导出紧凑的领域专用规则画像,在线对每条轨迹做预处理、标记启发式失败信号、在固定全局预算下序列化,并调用单一评分式 LLM 评审生成结构化诊断报告;在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上,相比 AgentRx,其失败定位与人工标注的对齐度在 Magentic-One 上提升约 20–35 个百分点、在 τ-retail 上最高提升 23 个百分点,同时成本降低约 6 倍、评估时间缩短 8 倍以上,并已部署于其企业智能体平台。该工作提出 LiteTrajEval,一种预算受限的轻量轨迹评估架构:离线导出紧凑的领域专用规则画像,在线对每条轨迹做预处理、标记启发式失败信号、在固定全局预算下序列化,并调用单一评分式 LLM 评审生成结构化诊断报告;在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上,相比 AgentRx,其失败定位与人工标注的对齐度在 Magentic-One 上提升约 20–35 个百分点、在 τ-retail 上最高提升 23 个百分点,同时成本降低约 6 倍、评估时间缩短 8 倍以上,并已部署于其企业智能体平台。