跳到主要内容
返回时间线
arXiv来源发表:

SAP Signavio 提出“组织记忆”架构,让 LLM 智能体在采购流程中的政策合规率从 30% 提升到 88%–95%

核心概要

该工作提出面向智能体业务流程执行的“组织记忆”(organizational memory)概念,即一个共享、受人类治理、可被智能体消费的组织专属流程知识参考层,并给出其需求(R1–R9)、涵盖记忆策展与运行时消费的架构,以及以“过程原子”(process atom)为单位的实现;在采购到付款(purchase-to-pay)场景的概念验证中,10 个场景、每个场景 4 次运行的平均政策合规率(PCR)显示,接入组织记忆的智能体在 GPT-4.1 上达到 88%、在 Claude Sonnet 4.5 上达到 95%,高于 RAG 方案(70% 与 80%)和无知识接入的基线(两者均为 30%)。

Source-provided article image: Organizational Memory for Agentic Business Process Execution
Fig. 1

Fig. 1: Running purchase-to-pay example: each agent depends on overlapping knowledge that is fragmented across heterogeneous artifacts.

· 第 4 页

深度剖析

论文提出并定义了“面向智能体业务流程执行的组织记忆”:一个共享、人类治理、可被智能体消费的组织专属程序性知识参考层,用于回答“工作应当如何执行”。 既有工作要么把组织知识编码进单个智能体的提示或检索配置,要么聚焦单个智能体的记忆机制(如记忆分层、记忆流、长期对话记忆);本文把组织流程知识视为企业级共享资源,强调跨智能体、跨流程的一致维护与治理。 属于概念与架构层面的论证,基于采购到付款的贯穿案例(BPMN 模型、SOP、采购政策、ERP 文档、知识库文章、历史执行经验)推导出五类挑战,并据此提出 R1–R9 九项需求。

论文提出一套组织记忆架构,包含记忆策展(Memory Curation)与记忆消费(Memory Consumption)两个阶段,并以“过程原子”作为最小知识单元。 与把文档统一为纯文本或文档块的做法不同,过程原子是自包含单元,只承载一条规则、约束或职责,并把适用条件(Applicability)与所需行为(Action)、目的(Purpose)分离,同时带有名称、来源引用和基于企业领域模型的分类标签。 架构设计明确对应需求:原子化分解支撑冲突检测(R3)、按规则更新(R7)、逐条溯源(R4)与最小充分集检索(R5);标签接地支撑上下文检索;策展阶段由 Global Curator 做质量与重复/冲突检查,再由人类专家审核批准(R8)。论文说明检索机制本身留待具体实例化,并未声称或评估某一种机制最优。

在采购到付款的概念验证中,接入组织记忆的智能体取得最高的政策合规率:GPT-4.1 为 88%,Claude Sonnet 4.5 为 95%,高于 RAG(70% 与 80%)和无知识接入基线(均为 30%)。 RAG 在所需规则与员工请求语义接近时有效,但在跨切面规则上失败,例如员工申请笔记本却未填成本中心时,RAG 智能体仍创建了 PR,因为该通用规则位于财务政策中、与请求语义不接近;组织记忆通过检索任务相关原子而非仅依赖相似度来缓解这一限制,并能处理需要联合考虑多条政策的场景。 实验使用 9 份人工编写的 PDF 文档(5 份采购相关、4 份来自 HR 等其他职能的干扰文档),编码 11 条规则;10 个场景,每个场景 4 次运行,结果取平均;正确性通过对照人工构建的 ground truth(Create/Refuse 及物料、数量、供应商字段)以规则化方式判定;三种设置使用同一 LLM 与系统提示。

论文指出组织记忆的有效性不仅取决于运行时检索,也取决于记忆策展质量:记忆智能体剩余的错误主要是“过度限制”,即拒绝本应合规的请求,检查显示原因是一个抽取不精确、适用范围过宽的原子。 这把评估焦点从单纯的检索策略扩展到原子抽取与策展的精度,并据此提出工程侧(面向 PDF 之外更多知识源的稳健抽取机制)与管理侧(责任、问责、生命周期管理、更新传播、规模化治理)的未来研究方向。 该结论来自对概念验证中错误案例的检查,论文同时明确说明结果应谨慎解读,因为评估具有初步性质和有限范围,且组织记忆并非设计用来也不能保证在所有情况下都正确执行流程。

启示与展望

该结果面向企业中以 LLM 智能体执行流程任务的场景,尤其是需要组织专属程序性知识(政策、职责、系统、异常处理惯例)才能正确决策的环节;论文以采购到付款中的采购申请创建为例,智能体需判断请求是否合规,合规则创建 PR 并填入正确信息,不合规则拒绝并说明原因。架构层面,策展阶段可接收政策、SOP、流程模型、系统文档、知识库文章与历史执行轨迹等输入,但论文为简化只聚焦 PDF 文档(政策与 SOP),并说明为所有可能输入源设计抽取服务超出本文范围。消费阶段面向运行时智能体,通过上下文请求与检索器返回最小充分原子集,标签接地使原子可按流程、活动、角色、对象类型或组织上下文检索。人类治理被设定为必要环节:专家审核原子变更,可接受、修改、拒绝或另行解决冲突,不同部门(如财务、采购、合规)对不同规则负责。

概念验证覆盖的是单一合成采购流程与仅含 PDF 的小型政策语料,向真实企业环境(大量重叠政策、流程模型、冲突来源与遗留文档)的推广尚未得到验证,这是论文自己指出的开放问题。记忆智能体的剩余错误主要是过度限制,源于抽取原子的适用范围过宽,说明抽取与策展精度对结果影响显著,但论文未给出系统性的抽取质量评估。检索机制在架构中被有意留待实例化,论文不声称也不评估某一种机制最优,因此“最小充分集”在实际企业规模下如何稳定避免欠检索与过检索仍是待研究问题。此外,本文为全文阅读,但图 2(架构总览)与图 3(结果柱状图)以图像形式呈现,其内部细节无法从文本中逐项核对,结果数值以正文叙述为准。

来源