跳到主要内容
返回时间线
arXiv来源发表:

研究者提出智能体认知深度五维轨迹评估框架,主张同一端到端得分下应报告分项画像

相关研究与后续进展

核心概要

该工作把以规划、记忆、工具与控制流四组件构建的LLM智能体系统,重新表述为轨迹层面的五维“智能体认知深度”画像——上下文敏感性、时间连续性、多模态协调、自适应交互与元认知监控,为每个维度给出可操作代理指标与扰动程序,并把画像关联到智能体世界模型,提出用扰动测量、部署期动态观测与机制可解释性三种互补方式测量,同时指出符号验证器、结构化记忆、规划器耦合与工具约束等神经符号设计模式可用于构建和检验这些能力。

Source-provided article image: Agentic Cognitive Depth: Operational Criteria for Evaluating LLM Agents
Fig. 1 ·

Fig. 1. Agentic cognitive-depth criteria as measurements of the four-component agentic architecture [87]. Each object-level component supports one criterion, which measures how well that component is used across the trajectory (Control Flow →C, Mem- ory →T, Tools →M, Planning →A). Metacognitive monitoring (Mc) names a meta- level layer that monitors and regulates the loop. Operational proxies and perturbation procedures are in Table 1.

arXiv · 第 7 页

深度剖析

提出把智能体LLM系统的应用型四组件(规划、记忆、工具、控制流)转化为轨迹层面的可测量画像,包含上下文敏感性、时间连续性、多模态协调、自适应交互、元认知监控五个准则。 既有单调用基准(MMLU、HELM、BIG-bench、GPQA)聚合任务分数,智能体基准(GAIA、SWE-bench、AgentBench、WebArena)只测端到端完成,二者都让智能体循环中失败的具体环节不清晰;该工作把评估对象明确设为完整轨迹,并给出逐准则诊断结构。 属概念与测量框架论文,未报告新实验数据;论证依据是对既有框架与基准的对照分析,以及SWE-bench Pro低于SWE-bench Verified、TRIP-Bench易分不超过五成且难分子集低于一成等已发表结果。

把元认知监控单列为第五个准则,作为位于对象层循环之上的监控与控制层,并指出当前智能体框架通常缺少这一层。 前四个准则衡量已有组件被使用的程度,第五个准则衡量系统是否监控并调节整条轨迹;自反思与重试循环最接近,但通常只修正局部答案而不调节整条运行。 引用MIRROR在八家实验室十六个模型上评估四层元认知行为,发现组合式自我预测普遍失败、自我知识常无法迁移或从反馈更新;同时引用自报置信度与正确性相关、模型可部分监控内部激活等工作,说明存在监控信号但控制环节仍薄弱。

把五个准则关联到智能体的世界模型,即对任务、环境、工具与自身状态的持续维护表征,并列出七个组件及其外部化形式。 当前智能体系统的世界模型组件分散在提示、权重、向量库、工具与控制器代码中,难以检查与更新;该工作主张将领域知识、工具/动作模型、环境动态、自我模型、他者模型、任务模型与因果模型外部化为知识图谱、PDDL规范、状态机、能力注册表、显式对手模型、目标规范与结构因果图。 属设计建议与文献综合;引用显式世界模型、预条件与效果预测、SimuRA基于LLM世界模型的模拟规划、以及将规划失败与缺少显式问题表征相联系的工作作为支撑。

给出扰动测量、部署期动态观测与机制可解释性三种互补测量模式,并提出“能力夸大”概念:聚合分数通过基准阈值而某准则分数低于阈值时,分数更多反映假象而非底层能力。 扰动方法把NLP行为测试扩展到轨迹层面,按准则分组设计扰动;动态观测捕捉数周承诺漂移与部署规模校准;可解释性用探针与电路分析查看内部状态。三者按准则配对使用,并可在既有基准上以较小常数倍成本扩展。 方法学提案,未给出实测画像;成本论证基于每个扰动只运行一次基础任务,动态观测在已有遥测时几乎不增加成本,可解释性可选择性应用。

启示与展望

该框架面向可观测完整轨迹的智能体系统,用于在既有基准之上增加逐准则诊断,服务对象是智能体评估与架构设计人员。适用设定是:任务保持留出、重复运行、并保留轨迹日志以区分模型、脚手架、接口、控制器、记忆与工具层的变化。作者建议的下一步实验是把表1的五类扰动应用于GAIA、SWE-bench Pro与ARC-AGI-3留出样本上的前沿智能体,在端到端分数旁报告画像;并指出ARC-AGI-3的环境本身已要求这些行为,适合作为试验台。设计层面,符号验证器、结构化记忆、规划器耦合、本体约束的工具路由与难度感知控制被列为可构建和检验这些能力的神经符号模式。

准则的代理指标、画像假设与第6节的工作案例均为示意性,尚待实证;五准则可测量但联合充分性仍开放,且彼此重叠,一次轨迹失败可能同时拉低记忆、规划与控制流多项分数,根因分析仍需步骤级证据。评分细节(阈值、任务选择、可靠性检查、成本报告与聚合方式)有待进一步规定。架构映射较为抽象,因为真实智能体混合了提示、检索、工具、控制器代码、记忆存储与人工输入。作者提出的核心假设——相同端到端分数的智能体在画像上分离且该差异预测部署失败——是可证伪的,但直接检验需要匹配的智能体、留出扰动集与重复运行。此外,本文为完整文本,但表格中的符号标记在纯文本中部分丢失,逐准则覆盖矩阵的具体符号需对照原文表格确认。

来源