SEDIMA 为进化搜索智能体加入跨运行分层洞见记忆,在 AlgoTune 与 ALE-Bench LITE 上分别提升 5.5% 与 6.6% 平均最终性能
相关研究与后续进展核心概要
该工作提出 SEDIMA——一种面向 LLM 驱动进化搜索智能体的持久化分层洞见记忆:它把原始搜索轨迹蒸馏为自然语言洞见,用注意力加权质心按语义相似度聚类,并检索相关指导来条件化后续变异,从而跨运行、跨问题积累可迁移知识;作为不修改搜索算子的即插即用模块,在固定 100 个候选评估预算下使 AlgoTune 平均最终性能提升 5.5%、ALE-Bench LITE 提升 6.6%,并在 OpenEvolve 下于五个被评估骨干模型上平均减少 32.3% 的迭代次数即可达到基线最佳性能。
Figure 1: Overview of Sedima . A persistent three-level memory (right) augments an evolutionary search loop (left, dashed): evaluated children are distilled into hierarchical insights on save , and relevant insights are injected into the mutation prompt on retrieval .
arXiv深度剖析
SEDIMA 把原始搜索轨迹蒸馏为自然语言洞见,并按语义相似度用注意力加权质心进行聚类,形成分层的持久记忆。 既有 LLM 驱动进化搜索系统基本是“无记忆”的,每次运行都从头探索,导致智能体反复重新发现同样的改进、反复撞上同样的死胡同;SEDIMA 将知识积累从单条轨迹扩展到跨运行、跨问题。 摘要给出了机制描述(蒸馏、注意力加权质心聚类、检索指导条件化变异),并以 AlgoTune、ALE-Bench LITE 与 OpenEvolve 上的量化结果作为支撑。
SEDIMA 是即插即用模块,不修改搜索算子,在固定 100 个候选评估预算下提升平均最终性能:AlgoTune 提升 5.5%,ALE-Bench LITE 提升 6.6%。 提升来自记忆与检索层而非改动搜索算子本身,说明跨运行知识复用可以独立于具体搜索算法带来收益。 两个基准上的平均最终性能提升百分比,且明确限定在固定 100 个候选评估预算下。
在 OpenEvolve 下,SEDIMA 在五个被评估骨干模型上平均减少 32.3% 的迭代次数即可达到基线最佳性能。 把收益从“最终性能更高”扩展到“达到同等水平所需迭代更少”,即样本效率层面的改善。 跨五个骨干模型的平均迭代减少比例,属于效率类指标而非仅最终分数。
启示与展望
该结果面向使用 LLM 驱动进化搜索做自动程序与算法发现的场景,尤其是需要在多次运行、多个问题之间复用经验的智能体系统。其收益是在固定 100 个候选评估预算下测得的,并已在 AlgoTune、ALE-Bench LITE 以及 OpenEvolve 下的五个骨干模型上报告;因此它最直接适用于以这些基准与框架为代表的、以候选评估次数为预算约束的搜索流程。作为即插即用模块,它适用于希望在不改动搜索算子的前提下引入跨运行记忆的团队。
可核验的信息限于摘要所述范围:洞见蒸馏与聚类的具体实现、检索如何与变异算子交互、以及 5.5%、6.6%、32.3% 这些数字背后的方差与逐任务分布,均未在本文本中展开。读者仍会关心:跨运行记忆在问题分布变化或迁移到新问题族时是否保持有效,记忆规模增长后检索质量与成本如何变化,以及在不同候选评估预算下收益是否同向。这些属于后续可检验的开放问题。
