跳到主要内容
返回时间线
arXiv来源发表:

Org-Agent 用任务依赖图与约束感知执行,把单用户助手扩展为服务多用户的组织型智能体

核心概要

该工作提出 Org-Agent,一个以组织约束为中心的推理框架,把任务分解为原子子任务并构建任务依赖图(TDG),按拓扑序调度、在约束规则下借助证据获取与记忆管理工具执行每个子任务;在 GroupMemBench 上平均准确率 44.03%,高于 BM25 的 37.72% 与最强记忆系统 Hindsight 的 38.79%,在 MUSES-Bench 上三个主干模型平均分分别提升 8.27、4.24、5.29 个百分点,消融显示依赖建模与工具使用均有贡献。

AI-generated editorial illustration: Org-Agent: Beyond Personal Assistants Towards Organizational Agents

深度剖析

论文把组织型智能体的能力归纳为两个互补维度:跨用户交互与决策,以及跨用户记忆与知识使用,并指出二者都受三类组织约束支配——用户身份、权限与访问许可,信息的归属与时效有效性,以及跨用户冲突解决规则与联合决策的完成条件。 此前智能体系统主要面向单用户设计与评测,论文把多用户共享一个智能体的场景显式建模,并把约束作为执行的前提条件与执行中必须满足的条件,而不是靠拼接所有用户请求或分别独立处理。 这是概念与问题设定层面的贡献,论文用产品发布排期、登录方式问答等例子说明,并引用 MUSES-Bench 与 GroupMemBench 两项已有基准来具体化需求。

Org-Agent 构建动态任务依赖图(TDG):节点是原子子任务,分为查询节点、决策节点与响应节点,边编码子任务之间的依赖;当新的用户输入改变待办子任务时,图会被更新,必要时重建。 与把请求简单拼接或逐用户独立处理不同,TDG 把约束诱导出的跨用户依赖显式表示为有向无环图,并在执行过程中随新输入调整剩余计划。 论文给出图建模与三步构建流程(子任务分解、依赖识别、图更新),并说明检测到环时由 LLM 修正;消融中移除全部边后 GroupMemBench 平均分从 44.03% 降至 41.61%,MUSES-Bench 从 72.39% 降至 71.10%。

在 TDG 之上,框架用拓扑排序得到执行顺序,保证每个节点在其前置节点之后执行,并支持按拓扑层并行;每个节点在约束规则下执行,由证据获取工具(相似度打分、条件过滤、关系遍历)与记忆管理工具(读、写累积执行记忆)支撑。 论文不单纯依赖模型自身推理来处理约束,而是把约束处理落到工具与调度机制上,使检索可以按作者、角色、项目阶段等元数据过滤并沿显式链接追溯讨论与决策变化。 消融中禁用条件过滤、关系遍历与记忆管理后,GroupMemBench 平均分降至 40.40%,MUSES-Bench 降至 67.10%;案例研究显示,按提问者身份过滤可避免 BM25 因词面重叠而返回他人决策的错误。

实验显示 Org-Agent 在两项基准上均取得提升:GroupMemBench 平均准确率 44.03%,超过 BM25 6.31 个百分点、text-embedding-3-large 10.74 个百分点、最强记忆系统 Hindsight 5.24 个百分点;MUSES-Bench 上 GPT-4o-mini 平均 72.39%(提升 8.27 点),DeepSeek-V4.1-Flash 85.02%(提升 4.24 点),Qwen3-32B 68.76%(提升 5.29 点)。 论文报告现有记忆系统在跨用户记忆与知识使用上并不稳定优于基础检索基线,多数低于 BM25;Org-Agent 的增益不需要在提问前预先构建记忆图,且在用户规模增大时性能下降更慢。 GroupMemBench 含 745 个问题、六个查询类别,MUSES-Bench 含 1,183 个场景、四类任务,用户规模 2 至 20;答案正确性由 LLM 裁判评估,Instruct 由规则检查器判定;成本分析显示 Org-Agent 以 5.5M tokens 达到最高准确率,少于 LightMem 的 21.6M 与 Hindsight 的 117.5M。

启示与展望

该框架面向一个共享智能体服务多用户的组织场景,适用于存在身份、权限、信息归属与联合决策约束的工作流,例如产品发布排期、跨用户信息访问与会议安排。论文在 GroupMemBench(745 个问题,覆盖 Finance、Healthcare、Manufacturing、Technology 四个领域与六类查询)和 MUSES-Bench(1,183 个场景,用户规模 2 至 20)上验证,主干模型包括 GPT-4o-mini、DeepSeek-V4.1-Flash 与 Qwen3-32B,并在附录中用 Qwen3-8B 复核。对希望把单用户助手升级为组织型智能体的团队,这套以约束为中心、按依赖调度并配合证据获取与记忆管理工具的做法可直接作为设计起点;论文也说明代码与资源可通过匿名仓库获取,README 提供复现指引。

论文报告的是两项基准上的评测结果,跨用户记忆与知识使用在 GroupMemBench 上以 LLM 裁判判定答案正确性,跨用户交互与决策在 MUSES-Bench 上以规则检查器与场景成功率衡量,这些设定下的结论向真实组织部署迁移时仍需观察。用户规模趋势来自 2 至 20 人的评测范围,更大规模下的表现是开放问题。超参数敏感性显示相似度打分中词面与语义权重的平衡会影响结果,不同领域与语言下的合适取值仍待检验。成本分析基于 GPT-4o-mini 在 GroupMemBench 上的 token 消耗,其他主干与任务下的成本结构尚需进一步观察。

来源