SGAnalog 用 273 个开源流片电路构建基准:最强模型转录精确同构 56.1%,尺寸任务最高 91.2 分
相关研究与后续进展核心概要
作者从 Tiny Tapeout 开源流片仓库按提交版本固定抓取人类设计的模拟电路,构建含 273 个拓扑互异顶层设计的 SGAnalog 基准,定义原理图到网表转录与器件尺寸两项任务;在 66 个转录任务上七个模型中最强者达 56.1% 精确图同构,在 17 个尺寸任务上领先模型全部收敛并得 91.2 分(满分 100),且两项任务给出不同模型排名。
Figure 2: Both tasks, end to end. Top: transcription. The input schematic image (left) and claude-opus-5’s verbatim output netlist (right) for a five-transistor OTA. Its net names differ from the drawing, but its graph is isomorphic to the reference. Bottom: sizing for a fully differential amplifier. The model receives the topology with sizes removed, then its proposal and the human reference run in the same author testbench. Aggregate results appear in Table 3 .
arXiv深度剖析
基准由 27 个 shuttle 索引出发,经无 blob 克隆与许可证核验,最终得到 933 个电路、425 个顶层设计、273 个唯一器件—网络图,并固定出 66 个转录任务与 17 个尺寸任务。 与来自教科书、论文插图或合成枚举的既有模拟基准不同,这里每个电路都在 shuttle 索引记录的提交版本上抓取,图像与 SPICE 网表由同一 .sch 源文件导出,无需单独标注步骤。 采集漏斗与组成表逐级给出计数;许可证从固定提交处的许可证文本核验;分类表在两次完整运行间逐字节一致,仿真表除每次运行的时间列外可复现。
转录任务以图同构而非文本匹配评分,把 MOSFET 漏源视为可互换并忽略网络名,同时报告结构 F1 与 W/L 参数准确率。 该评分方式使渲染风格成为可控干扰变量,并让同一套评估可跨任意测试台状态的电路使用,从而支持按提交日期的分析。 在 claude-opus-5 上,遮蔽作者自选标签使精确同构从 51.5% 降至 36.4%,结构 F1 不变而参数准确率上升;由于评分器忽略名称,作者将其解释为标签充当连线追踪的视觉锚点。
尺寸任务在固定拓扑上让模型给出器件尺寸,以同一 PDK、测试台与仿真器下人类作者尺寸的仿真性能为参照,按模型与参照的指标比值评分。 参照不是文献中的放大器拓扑,而是提交作者本人的设计在同一测试台下的表现;不收敛或无尺寸的提案得零分,收敛但无可比标量指标得生存分 1。 17 个任务来自 412 次作者测试台运行中通过 600 秒、真实器件卡与层级解析门槛的 190 次运行;领先模型全部 17 个提案收敛并得 91.2 分,而两个最新 Claude 模型在同样能无异议转录的提示上分别拒答 4 与 11 个。
基准提供提交日期、遮蔽渲染、发布金丝雀与闭卷协议,用于探查潜在的训练或推理期暴露。 闭卷评估在构造上不声明任何工具,遮蔽渲染移除作者自选标签,金丝雀标记生成产物;作者明确区分训练期通道与推理期检索通道。 作者说明提交日期比较是描述性的而非污染估计,因为日期边界两侧难度不同、图哈希组未跨边界分离,且设计的早期版本可能早于固定修订;两个可用旧截止比较中精确匹配未见一致的截止前优势。
启示与展望
该基准面向原理图级推理,不涉及版图或主观设计风格;转录衡量模型能否从图像恢复电路结构,尺寸衡量模型选择的器件尺寸能否在作者测试台中保持仿真行为。固定任务集是更广采集的资格过滤子集,转录 66 题、尺寸 17 题,跨模型保持不变。发布物包含对已验证电路—测试台对的浏览器界面,以及十个代表性对的预计算运行静态页面,仅需 Docker 即可运行。作者列出后续里程碑:按类别的测量模板(从放大器类的增益、增益带宽积与相位裕度开始)、逐电路记忆探针,以及拓扑生成任务。
提交日期比较是描述性的,作者明确说明它不是污染估计,因为日期边界两侧难度不同、图哈希组未跨边界分离,且早期设计版本可能早于固定修订。遮蔽渲染结果与标签作为视觉锚点的解释相容,但作者指出它不能排除先前暴露。尺寸任务的人类尺寸在上游仓库公开,因此作者以扰动工作点与复述诊断来评分。拒答集合在整体上稳定但并非逐提示稳定:claude-fable-5 的完整重跑拒答 12 个,其中十个两次都拒答、三个改变立场。作者还指出收敛本身门槛过弱,有提案收敛但输出摆幅低于参照的百分之一。拓扑生成因缺少统一设计简报表示与自动引脚匹配而未在本版本中声称。
