阿里团队提出PoS:用显式信念状态加Belief Trapping检测与恢复,在四个基准、三个骨干上全部取得最高分
核心概要
该工作提出推理时框架PoS,把智能体的决策上下文从交互历史改为持续维护的显式信念状态(世界状态加未解决的认识缺口与成就缺口),并用Belief Sentinel做一致性校验、用窗口级信号检测Belief Trapping(停滞、循环、漂移)后按模式与受阻缺口类型组合恢复约束;在ALFWorld、LOCA-Bench、RCA-100、ClinDiag四个基准与Qwen3.7-Plus、Kimi-K3、GLM-5.3三个骨干的全部12个组合上取得最高总体表现,相对同骨干最强基线的增益最高达ALFWorld 22.68%、RCA-100联合准确率37.89%。
深度剖析
PoS把智能体的决策上下文从“历史记录”改为“任务条件下的显式信念”:世界状态用Entity–State–Relation结构表示并标注来源与置信度,同时把未解决需求拆成认识缺口(还需了解什么)与成就缺口(还需完成什么),并从中选出一个active gap作为当前焦点。 既有记忆类方法(Raw Trajectory、ACON、PACE、HiAgent)产出的是被压缩或重组的历史证据,LongHorizon-Harness等状态类方法依赖可独立验证的中间产物;PoS则把“当前世界是什么样”与“还差什么”合并成一个可检查、可修订的决策状态。 论文给出POMDP形式化、信念更新公式与active gap选择机制,并在附录给出完整符号表与算法流程;属于方法层面的构造性贡献,其价值由后续四个基准的实验间接支持。
PoS引入Belief Sentinel对候选信念更新做一致性校验,区分内部不一致(同一实体被赋予互斥状态)与外部不一致(与最新观测或交互证据冲突),校验后再由任务智能体依据证据修订并提交。 论文指出信念更新由LLM自身生成,可能继承错误假设或幻觉;此前工作虽也构建显式信念,但未把“持续校验”作为信念维护的固定环节。 消融实验显示去掉一致性校验后四个基准表现均下降,ALFWorld与LOCA-Bench上的损失最大,ClinDiag损失相对较小;论文将此归因于复杂交互中调和状态变化与观测的风险更高。
论文命名并刻画了Belief Trapping——智能体持续行动却未向目标实质推进——用gap persistence、progress stagnation、belief recurrence三个窗口级信号合成信念健康度,检测后按智能体动态(static、cycle、drift)与受阻缺口类型做因子化诊断,再组合模式专属的逃脱约束与缺口专属的推进约束。 T3只检测信念偏离并在强化学习中截断无信息轨迹,CGDP用耗尽门终止无产出的上下文收集,二者都不在推理过程中恢复进展;PoS则保持active gap不变并施加额外约束以重定向后续动作。 消融显示去掉Trapping Diagnosis及恢复后四个基准均下降,RCA-100与ClinDiag损失较大;与“通用恢复提示”变体的对比中,因子化恢复在四个基准上均更优。
在四个基准、三个骨干的全部12个基准–骨干组合上,PoS取得最高总体表现,相对同骨干最强基线的增益最高达ALFWorld 22.68%、LOCA-Bench、RCA-100联合准确率37.89%、ClinDiag;在LOCA-Bench上下文从8K增长到256K时,PoS在96K至256K区间表现大体稳定,256K处超出最强基线若干点。 论文同时报告了基线之间的反转现象:PACE在LOCA-Bench上低于Raw Trajectory,LongHorizon-Harness在RCA-100与ClinDiag上增益不稳定,GLM-5.3的ClinDiag上没有任何上下文管理基线超过Raw Trajectory;PoS的增益横跨执行与诊断两类任务。 主表覆盖ALFWorld 134例、LOCA-Bench 525例、RCA-100 103例、ClinDiag 604例(Common与Rare各302例,Emergency子集因数据访问限制被排除),所有方法使用相同基准适配器、工具接口与动作预算,LLM调用采用temperature 0的确定性解码。
启示与展望
该框架面向需要跨多步维持世界状态的长时程智能体决策,适用于执行类任务(ALFWorld、LOCA-Bench)与证据搜寻式诊断任务(RCA-100、ClinDiag),且以推理时方式运行、不需要额外训练,因此可直接叠加在已有骨干模型上。论文的评估覆盖三个骨干与四个基准,所有方法共享同一基准适配器、工具接口、终止协议与动作预算,LLM调用使用确定性解码。对读者而言,这意味着PoS更适合作为“上下文管理层的替换件”来理解:它不改变底层模型能力,而是改变每一步决策所依据的状态表示。论文也指出,显式信念维护带来额外token与计算开销,其自然语言形式的信念需要反复文本处理,未来可探索任务条件下的潜在世界状态表示以降低开销;同时PoS未系统整合外部领域知识检索,识别相关证据与解释观测的能力主要依赖骨干模型已有知识。
论文为快速解析版本,正文中的公式编号、图3与图4的具体数值、以及部分相对增益的百分数在文本中未完整呈现,因此对陷阱发生率分布、恢复策略对比幅度与上下文扩展曲线的精确读数仍需查阅原文图表。此外,Belief Trapping的检测依赖窗口大小、最大递归滞后、递归距离阈值、健康阈值等一组超参数,论文给出取值但未在正文展开其敏感性;信念健康度采用“较强停滞或递归信号乘以缺口持续性”的加权形式,论文在附录用三个边界配置说明其相对几何平均与最大值的取舍,但不同任务分布下该设计的表现仍值得继续观察。成本方面,PoS在RCA-100上把任务智能体的token消耗降低,但总消耗因信念构建与维护而上升,论文将降低这一开销列为未来方向。最后,论文自身指出显式信念无法替代执行技能与领域知识:LOCA-Bench的Env.Ops类别成功率仍处于较低区间,ClinDiag中不少错误诊断发生在智能体已获得正确信息但缺乏医学知识加以解释之时。
