跳到主要内容
返回时间线
arXiv来源发表:

面向耦合语义例程生成的LLM上下文动态适配

核心概要

该工作提出“动态上下文适配”:一个由验证智能体从执行轨迹中提取结构化诊断反馈、生成智能体每轮提出多个候选、并以知识图谱提供语义约束、以模拟退火进行非贪心选择的验证—生成循环,用于缓解其称为“静态绑定”的LLM代码生成局限;在八个问题中,该方法在300与600次评估时于七个问题上优于零样本、Reflexion与OpenEvolve(p<0.01),在1000次评估时于主要动机问题(跨耦合优化)取得最佳分数(0.694 对 0.681,p=0.019,d=0.52),消融显示结构化执行反馈是主要驱动因素。

Source-provided article image: Dynamic Adaptation of the LLM Context for Generating Routines with Coupled Semantics
Fig. 2

Fig. 2: Left: validation-generation pipeline. Right: SA selection with Metropolis acceptance and geometric cooling.

· 第 6 页

深度剖析

提出软件组件间意义依赖的形式化分类,刻画LLM“静态绑定”局限:独立、发送方依赖接收方、接收方依赖发送方、发送方与接收方交叉相关四种情形,并给出对应关系式。 此前工作多把LLM代码生成失败归因于提示或搜索策略,该文把“一个例程的含义由另一个例程的运行时行为定义”这一关系显式形式化,并指出静态链接概念隐含假设各概念含义相互独立。 属概念与形式化贡献,以迷宫导航与跨耦合优化两个示例及图1的依赖结构说明,未涉及统计检验。

提出双智能体加知识图谱的系统架构:验证智能体执行候选并输出结构化诊断(失败模式、错失机会、约束违反),生成智能体结合当前最优候选与KG约束每轮提出k个候选,再由模拟退火选择。 相较Reflexion的单轨迹口头反思与贪心接受,该架构引入结构化诊断提取、每轮多候选生成、KG语义层与非贪心选择;相较AlphaEvolve类方法,其定位是低评估预算下的样本效率。 架构描述与表1的定性对比支撑;实验使用Qwen2.5-72B本地部署,SA参数T0=2.5、α=0.85、Tmin=0.01,每问题约333轮×3候选≈1000次评估,10个随机种子。

给出样本效率的经验证据:在300与600次评估时,该方法在八个问题中的七个上优于OpenEvolve(均p<0.01),与基于种群的搜索的经验交叉点约在600–800次评估。 把“反馈驱动早期收敛”与“种群式渐近探索”的权衡定位为互补关系,并给出交叉点的经验位置(圆填充约650次、迷宫约710次评估)。 表3与图4给出300/600/1000次评估的均值±标准差,10个种子,配对Wilcoxon符号秩检验;函数最小化为例外(300次时p=0.284)。

消融显示结构化执行反馈是最大单一贡献,其次为SA选择与KG约束:去掉反馈在四个问题上分别下降约28%(迷宫)、31%(圆填充)、12%(函数最小化)、11%(跨耦合),均p<0.001且d>1.1。 把系统增益分解到反馈、选择策略与语义层三个组件,指出无反馈时生成智能体退化为接近随机候选生成。 表4在300次评估下报告四类条件的均值±标准差与效应量;SA在离散高方差问题上影响更大(迷宫−16%,p<0.001,d=0.89),KG增益中等(迷宫−15%,p=0.001,d=0.78)。

启示与展望

该结果面向正确性依赖跨组件联合执行行为的例程级代码生成,尤其适用于评估预算有限(数百次评估量级)且能提供执行轨迹与测试向量的场景;对显式耦合问题(迷宫导航、跨耦合优化)与具有潜在执行耦合的标准基准(圆填充、TSP、滤波器设计、在线评测编程、符号回归)均给出经验结果。方法以本地部署的开源权重模型运行,七个问题在20分钟内完成,便于嵌入开发者迭代周期。

验证智能体诊断的是表层症状而非反事实推理,离散动作空间中单token改动会带来较大行为变化,因此方差偏高;反馈范围受测试套件边界约束,执行日志之外的潜在缺陷不在覆盖范围内;单最优候选设计在多盆地景观上的多样性有限。交叉点位置(约600–800次评估)与各问题上的具体数值来自本文实验设置,换用其他模型、预算或问题分布时其位置可能移动,值得后续在更多模型与多跳依赖链上继续观察。

来源