LAM 资源受限抽象把 LLM 智能体 harness 成本形式化,并在 GPT-6 Astra 上验证通信与可靠性预测
相关研究与后续进展核心概要
作者提出语言模型智能体机器(LAM)这一资源受限抽象,在固定底层语义模型的前提下显式计入 harness 层资源开销,得到通信、访问、重计算与可靠性四类结果,并在 GPT-6 Astra 的受控与留出实验中检验了通信与可靠性预测,包括检查点最优值、程序化检查下的策略选择以及链式 MATH 任务中调用粒度、逻辑输入流量与可靠性之间的权衡。
Figure 1. Overview of the lam: (a) an agent with active context, persistent memory, tools and verifiers; (b) the lam components; (c) the charged quantities (calls 𝑁, token traffic 𝑇in, 𝑇out, memory operations, capacities, target failure probability 𝛿); (d) red–blue pebbling (context blocks red, memory blocks blue, transfers communication).
arXiv · 第 1 页深度剖析
提出 LAM 资源受限抽象,把 harness 层资源(有界上下文、持久记忆、工具、验证、重复执行)显式计入成本,而底层语义模型保持固定。 既有模型能力概念不量化这些机制消耗的计算资源,LAM 将 harness 开销纳入可分析框架。 摘要层面给出抽象定义与四类结果的结构,未提供形式化细节。
通信结果:LAM 执行在同时调用—传输预算下与红蓝 pebbling 逐实例等价,从而把经典 I/O 下界迁移到上下文—记忆流量。 将智能体执行成本与经典 pebbling/I/O 下界理论建立等价关系。 摘要陈述等价性与下界迁移,未给出证明细节。
访问与重计算结果:记忆接口导致渐近分离,包括指针追逐中随机访问与非投机顺序访问之间存在 Θ(n) 差距;位反转 DAG 在上下文容量 C 与持久记忆容量 S 下需要 Θ(n²/(C+S)+n) 次模型调用。 量化了存储中间状态何时可避免重复语义计算,并给出访问模式的渐近分离。 摘要给出渐近表达式,未提供常数或实验规模。
可靠性结果:导出紧的阶段性局部采样界、不完美验证的精确成本,以及 Young–Daly 型检查点定律与闭式最优验证间隔;GPT-6 Astra 的受控与留出实验检验了通信与可靠性预测,包括检查点最优值、程序化检查下的策略选择,以及链式 MATH 任务中调用粒度、逻辑输入流量与可靠性的权衡。 把检查点与验证间隔的最优化纳入同一资源理论,并给出实验检验。 摘要说明实验覆盖通信与可靠性预测及若干权衡,未报告具体数值、样本量或效应量。
启示与展望
该工作面向以有界上下文、持久记忆、工具、验证与重复执行为特征的 LLM 智能体 harness,适用于需要在调用粒度、逻辑输入流量与可靠性之间做权衡的场景,例如链式 MATH 任务与程序化检查下的策略选择。其结论以固定底层语义模型为前提,因此适用于分析 harness 层资源而非模型能力本身。
摘要未给出证明细节、实验规模、具体数值或效应量,因此无法从摘要判断各渐近界的常数因子与实验覆盖范围。检查点定律与最优验证间隔的闭式解在实际 harness 中的适用条件,以及链式 MATH 任务上的权衡结论能否推广到其他任务类型,仍是需要阅读原文进一步确认的开放问题。
