EvoDuet 让大模型在进化搜索中按知识缺口检索网页,在 21 项优化任务上把 OpenEvolve 的归一化发现增益从 74.1% 提到 78.0%(GPT-5.6-Luna)、从 61.3% 提到 82.3%(Gemini-3.8-Flash),并在 8 项任务上超过此前最好成绩
核心概要
该工作提出 EvoDuet,一种在模型参数固定的前提下让解与网络搜索查询双层协同进化的方法:每轮由基于知识缺口的检索门决定检索新文档、复用已存文档或不检索,内层循环按“假设证据评分”预测文档能带来的解分数并据此改写查询,外层循环并行生成候选并把评估结果写回搜索数据库;在 21 项优化任务、每轮一个候选的设置下,它把 OpenEvolve 的归一化发现增益从 74.1% 提升到 78.0%(GPT-5.6-Luna)、从 61.3% 提升到 82.3%(Gemini-3.8-Flash),Qwen3.5-9B 未获益,最佳运行在 8 项任务上超过此前报告的最好成绩、3 项持平,并在 Sums/Diffs 与 Denoising 上同
深度剖析
把网络搜索从“解循环里的一个工具”改造成与解共同进化的双层优化:内层优化查询、外层优化解,二者通过基于知识缺口的检索门耦合,模型参数与提示模板全程固定。 此前的脚手架(如 EvoX 的策略循环)只依赖运行历史与模型参数知识,搜索是封闭的;DeepEvolve 虽加入网络搜索,但把搜索与解优化按顺序耦合而非双层形式。EvoDuet 让“何时搜、搜什么”由模型自评的知识状态决定,并用预测的候选分数来排序文档。 论文给出双层目标的形式化(式 1)与算法伪代码,并在 Denoising、Erdős 上比较随机门、停滞启发式门与知识缺口门,知识缺口门取得最高 NDG(Denoising 84.5%,Erdős 100.0%);在 Denoising、Sums/Diffs 上比较无搜索、joint-level、双层三种耦合方式,双层分别为 84.5% 与 76.0%。
在 21 项优化任务、每轮一个候选的设置下,EvoDuet 提升 OpenEvolve 的整体归一化发现增益:GPT-5.6-Luna 由 74.1% 到 78.0%,Gemini-3.8-Flash 由 61.3% 到 82.3%;并行生成进一步带来提升。 增益并非普遍:Qwen3.5-9B 在每轮一个候选时下降 14.4%,并行生成下仍下降 4.7%,尽管它在 oracle 文档条件下平均提升 10.3%。论文把这一对比归因于 EvoDuet 额外要求模型自行判断何时搜、搜什么,并报告在 50 个抽样修订中 6% 未使用方法、20% 实现错误。 结果基于 21 项任务、三种模型、两种候选预算(1 与 8)的对比;并行生成下 GPT-5.6-Luna 在 8 项任务上的平均 NDG 由 89.6% 升至 95.7%,Gemini-3.8-Flash 由 84.5% 升至 89.6%。
最佳运行在 8 项任务上超过此前报告的最好成绩、3 项持平,覆盖五个领域,11 次报告运行的平均成本为 45.56 美元;在 Denoising 上以 38.45 美元达到 100.27% NDG,低于 SimpleTES 约 265.39 美元的估计 API 等价成本。 论文同时给出机制层面的解释:检索到的文档最常被用于方法迁移(82 次运行中 55 次),其次是作为已发表最好分数的参考目标(40 次);公开成果复用只出现在 6 次运行中,11 项 SOTA 结果中仅 2 项的最佳程序复用了公开成果。 表 1(a) 逐项列出此前 SOTA 与 EvoDuet 的分数及成本,附录 K 给出 11 个最佳程序的完整源码与设计说明,并说明其中 8 项改进参考、3 项在容差内持平。
检索文档与解改进之间的关系被量化:当保留的文档中至少有一个“假设证据评分”高于父代实际分数时,被选候选在 67.1% 的迭代中优于父代、14.1% 创下运行最好成绩,而无文档时为 52.1% 与 9.6%;但预测会帮忙的检索中仍有 20% 产生更差的子代。 这为“预测分数作为内层目标代理”提供了经验支持,同时说明预测收益必须由评估器验证;论文还报告 4,324 次检索中假设证据评分与实际评估分数强相关,21 项任务上相关性均为正。 统计覆盖 82 次 GPT-5.6-Luna 运行、8,200 次迭代的行为审计,以及 33,784 次迭代、362 次 EvoDuet 运行的失败分析;Galileo 案例给出预测 0.63701、父代 0.63692、实际子代 0.37713 的具体反例。
启示与展望
该结果面向以确定性评估器打分的计算型优化任务,适用于希望把网络检索接入既有进化脚手架的研究者与工程团队;论文显示它可与 OpenEvolve、Top-K、EvoX 叠加,并在数学任务上取得最大平均增益(六种模型/预算设置平均 +7.1%)。它依赖模型自行判断知识缺口并实现检索到的方法,因此更适用于既能找到证据又能应用证据的骨干模型;论文也建议把证据选择与实现作为可分别训练和评估的能力。对算法工程类任务(AHC039、AHC058)改进并不稳定,六种设置平均下降 1.6%。
论文自身指出,EvoDuet 的收益随骨干模型变化,Qwen3.5-9B 在两种候选预算下都低于单独使用 OpenEvolve,其失败模式包括未使用检索到的方法与实现错误;算法工程任务上的改进也不稳定。此外,部分最佳程序依赖公开成果(如 Erdős 行保留运行时下载的公开见证),论文在附录 K 中标注了这一点,并建议对生成的程序做独立验证与来源标注。检索到的信息可能不可靠,公开成果复用也可能带来新颖性表述上的风险,这些都需要在后续使用中持续观察。
