跳到主要内容
返回时间线
arXiv来源发表:

EpiCon用两个2B模型搭建共享多模态记忆库,让不同智能体系统互相复用经验并把宏平均分提高1.7到4.9分

核心概要

EpiCon提出一个共享多模态记忆框架,用两个独立训练的2B模型(记忆控制器与树自组织器)把问题级的文本指导与视觉证据协同演化,并与持久经验库相连,在不更新宿主模型参数的前提下,让不同多智能体系统互相复用和贡献经验;在11个基准、4个多模态任务域、两种harness与多个骨干上,冻结记忆库即可在单次求解下提升其他系统,第二个harness使原系统宏平均分提高2.6分,四种宿主配置下2B版本比无记忆提高1.7至4.9分,并把记忆操作时间相对骨干规模记忆模型减少67%至74%。

AI-generated editorial illustration: EpiCon: Collective Agent Learning through Co-Evolving Multimodal Memory

深度剖析

EpiCon把问题级的多模态记忆演化与跨问题的持久经验库连接起来,形成不更新宿主参数的集体学习机制:记忆控制器在同一问题内根据多次尝试与反馈联合修订可执行文本指导与对应图像区域,树自组织器则把经验分层合并、抽象为可复用规则并按新问题检索。 既有工作多把记忆做成文本历史、分层笔记或跨模型共享的经验结构,而这里把文本指导与视觉证据的协同修订、以及跨harness跨骨干的经验积累放在同一个共享库中处理。 论文给出框架描述、公式化的更新与检索流程,以及两个独立训练的2B模型;训练监督来自约25K条经回放筛选的记忆变换与约6.5K条通过结构校验的树操作演示。

共享经验库可以脱离其构建者继续发挥作用:由Codex与Qwen3.8-27B构建的记忆库被Codex与Gemma4-31B复用、以及被DeepSeek-Harness与Qwen3.8-27B复用时,仅更换骨干或harness,宏平均分分别提高3.2分和4.2分,且评估时只做一次求解、关闭问题级更新。 这检验的是历史经验本身的可迁移性,而不是靠额外尝试次数换来的提升,因此把“经验复用”与“多轮反思”区分开来。 跨骨干与跨harness迁移在全部11个基准上比较,例如骨干迁移把MATH-Vision从25.8提高到33.0,harness迁移把ParseBench从52.4提高到65.7。

另一个harness贡献的经验可以反过来提升原构建者:Codex与DeepSeek-Harness双向交换构建与演化角色后,Codex的宏平均分从53.5升到55.7,DeepSeek-Harness从53.4升到56.6,演化后的库分别改善11个基准中的8个和9个。 这给出集体学习的直接证据——系统既能受益于他人经验,也能贡献新经验改善原贡献者的后续求解。 两个方向都在同一批4,388道题上以一次检索、一次求解、关闭问题级更新的方式比较原始库与演化库;论文同时指出效果依赖任务与贡献系统,例如ParseBench上Codex的分数在DeepSeek-Harness演化其库后从63.4降到58.9。

紧凑的2B记忆模型在性能与成本之间取得折中:相对骨干规模的记忆模型,记忆操作时间减少约67%至74%、总时间减少25%至35%,宏平均分低0.9至3.6分,但仍比无记忆高1.7至4.9分;消融显示树结构优于扁平存储(ParseBench从52.2升到67.3),自适应视觉注入在冻结或演化视觉记忆下都改善8项中的7项。 把记忆管理从骨干模型卸载到独立小模型,并分别量化了层级组织与视觉注入各自的贡献。 结果覆盖四种宿主配置与11个基准,并报告了时间与token的归一化成本;消融在固定控制器、关闭历史检索、共享最多五次尝试预算的条件下进行。

启示与展望

该框架面向使用外部记忆的多智能体系统:宿主保留自己的编排与骨干,记忆由两个2B模型与一个独立经验库承担,适用于文档理解、视觉到代码、视觉数学与通用视觉语言推理等需要图像证据的任务。它使系统可以在不更新宿主参数的情况下复用他人经验,也让经验库在更换harness或骨干后继续可用,并支持由不同系统轮流构建与演化同一个库。

跨harness演化的收益依赖任务与贡献系统,论文报告ParseBench上Codex的分数在他人演化其库后下降、MATH-Vision上DeepSeek-Harness从56.6降到53.4,因此哪些经验值得写入共享库仍是开放问题。树操作演示只经过结构校验而未逐条经下游回放验证,控制器监督也来自源任务上的回放,其向新任务的推广程度需要更多观察。通用视觉语言推理上的变化较小且不一致(ReasonMap与BabyVision),说明训练域之外的迁移仍有边界。此外,本次读取为全文,但表格与图以文本形式呈现,个别数值区间的具体端点无法从文本中确认。

来源