PrefixAgent 用两阶段大模型智能体与 e-graph 轨迹微调,在 64 位前缀加法器上把面积降到 938 µm²,比最强基线小 11.3%
核心概要
该工作提出 PrefixAgent,一个由大语言模型驱动的两阶段前缀加法器优化框架:第一阶段用微调后的大推理模型通过 regroup 工具调用迭代优化主干结构,第二阶段用 level-opt、fanout-opt 和 node clone 工具做局部时序修复;作者利用 e-graph 的等价饱和与解释机制生成可解释的重写轨迹作为监督数据,在 NanGate45 与 OpenROAD 流程下,PrefixAgent 在几乎所有配置中面积小于 DP、MCTS、PrefixRL、CircuitVAE、PrefixGPT 等基线,64 位下比最佳基线面积减少最多 11.3%,并在商用流程与 256-PE 脉动阵列中取得更小面积。
Fig. 1. The two-phase framework in PrefixAgent.
· 第 2 页深度剖析
把前缀加法器设计分解为主干生成与局部结构精修两个子任务,主干定义为计算最高位进位的子图,含 N−1 个节点,从而把指数级设计空间压缩为单个 Catalan 数。 此前方法要么依赖规则化结构,要么在完整前缀图上做搜索或直接生成;该工作首次把优化对象限制在主干上,并指出主干优化与 e-graph 重写一一对应。 论文给出主干节点数 S_B = N−1、辅助节点数 S_A = N−1−L_B 的推导,并说明 16 位设计空间从约 10^48 降到 10^6;主干与零缺陷条件 S+L=2n−2 的关系有 Snir 定理支撑。
用 e-graph 的等价饱和、时序感知代价函数与 egg 解释器,自动生成大规模、可解释的主干优化轨迹,作为大推理模型微调的监督数据。 以往训练数据靠随机生成或扰动,难以产生有意义的优化轨迹;该工作把结合律重写规则 R1 与 regroup 操作对应起来,用 egg explainer 抽取重写序列作为可解释轨迹。 论文报告了 8 位到 64 位的轨迹统计(如 64 位 16 个 profile、90 条轨迹、5760 步 regroup),并给出时序感知代价在 16 位主干上优于 AST-depth 与随机基线的关键路径延迟对比(如 profile 1 为 0.4862 ns 对 0.5684 ns 与 0.6692 ns)。
PrefixAgent 在均匀与非均匀到达时间下,于几乎所有配置中生成面积更小的前缀加法器,且优势随位宽增大而扩大。 相比 DP、MCTS、PrefixRL、CircuitVAE、PrefixGPT,该工作首次把基于大模型的方案扩展到 64 位,并在 64 位下 Pareto 支配所有基线。 非均匀到达时间表中,PrefixAgent 在八个配置中的七个取得最小面积,64 位下比最佳基线面积减少最多 11.3%;均匀到达时间下 64 位 Pareto 前沿支配全部基线;所有生成加法器均通过 ABC 等价性检查。
在商用物理设计流程与 256-PE 脉动阵列中,用 PrefixAgent 生成的加法器替换综合工具默认加法器,可减小面积并改善关键路径延迟。 此前工作多停留在学术开源流程;该工作把评估扩展到 32 nm 商用工具链与加速器级场景。 商用流程表中 PrefixAgent 在 LSB-first 与 Random 两种 profile 下面积均小于商用综合工具(如 64 位 LSB-first 为 1574.76 µm² 对 1639.09 µm²);脉动阵列在 OpenROAD 与商用流程、8 位与 16 位下面积与延迟均改善。
启示与展望
该结果面向需要在给定输入到达时间与目标延迟下优化前缀加法器的数字电路设计者,适用于 NanGate45 开源库加 OpenROAD 流程以及一套 32 nm 商用物理实现流程;作者指出主干加 e-graph 轨迹的监督范式可复用到乘法器压缩树模板与更广的数据通路 RTL/网表优化,因此对做算术数据通路与加速器设计的读者最有直接价值。
读者仍需关注:54 位是唯一被评估的未见位宽,且两种到达时间 profile 家族都出现在训练分布中,因此结果不足以确立对任意位宽或未见 profile 家族的泛化;主干加 e-graph 轨迹范式向乘法器与更广数据通路的迁移目前只是作者提出的展望,尚无实验;此外,主干优化与 e-graph 重写的对应依赖结合律这一特定重写规则,其他结构约束下是否同样成立值得进一步观察。
