跳到主要内容

研究进展

相关研究与后续进展

同一研究事件下的公开文章与后续进展。

arXiv

LiteTrajEval 以预算受限的规则画像与单一评分式 LLM 评审,将智能体轨迹失败定位与人工标注的对齐度提升约 20–35 个百分点,同时把成本降低约 6 倍、评估时间缩短 8 倍以上

该工作提出 LiteTrajEval,一种预算受限的轻量轨迹评估架构:离线导出紧凑的领域专用规则画像,在线对每条轨迹做预处理、标记启发式失败信号、在固定全局预算下序列化,并调用单一评分式 LLM 评审生成结构化诊断报告;在公开的 Magentic-One 风格与 τ-bench 风格轨迹数据集上,相比 AgentRx,其失败定位与人工标注的对齐度在 Magentic-One 上提升约 20–35 个百分点、在 τ-retail 上最高提升 23 个百分点,同时成本降低约 6 倍、评估时间缩短 8 倍以上,并已部署于其企业智能体平台。