跳到主要内容
返回时间线
arXiv来源发表:

CADFather 用视觉语言助手协调学习、几何与优化三类工具,在六个 CAD 重建基准上把无效输出降到零

核心概要

CADFather 是一个无需额外训练的自主智能体,用视觉语言助手在候选 CAD 程序池上决定扩展哪个程序、调用哪种工具以及采样多少提案,把学习式提案生成、基于几何拟合的算法式提案与参数优化统一在同一 CadQuery 表示中,并在 DeepCAD、Fusion360、MCB 全测试集上取得零无效率和更高的平均 IoU、GMS 与更低的中位 Chamfer 距离。

Source-provided article image: CADFather: Autonomous CAD Reconstruction through Coordinated Tool Use
Figure 1 ·

Figure 1: CADFather overview. Given a target mesh and feedback from existing CAD candidates, the visual assistant selects candidate programs to continue, tools to apply, and the number of proposals to generate. Learned and algorithmic proposals create alternative continuations, while parameter optimization refines existing candidates. The resulting programs are executed and evaluated, and the assistant visually accepts or rejects them before pool admission. Their renders and scores inform subsequent decisions. * In the figures, “stepwise” denotes learned proposals, and “deterministic” or “det” denotes algorithmic proposals.

arXiv

深度剖析

系统把三类互补工具放进同一个候选池与同一表示:学习式提案来自预训练的 CADENA-RL 操作生成器,算法式提案通过对目标网格做截面挤出拟合产生,参数优化只改草图坐标、半径与挤出深度而不改操作序列。 此前方法通常固定单一操作来源,或反复编辑同一个程序;CADFather 让视觉助手在每一步同时决定“继续哪个候选”和“用哪个工具”,并保留早期候选以便回溯。 方法描述完整,工具接口、候选表字段、预算与终止规则均有明确说明;学习与助手模型均为冻结权重,不使用额外训练。

在 DeepCAD、Fusion360、MCB 全测试集上,平均 IoU 分别为 0.987、0.976、0.913,高于 CADENA-RL sampling 的 0.966、0.952、0.895;无效率为 0.0000,即每个零件都以封闭实体结束。 学习工具使用同一个 CADENA-RL 检查点,因此提升并非来自更强的生成器,而是来自工具协调与候选搜索。 三个数据集规模分别为 8046、1725、5000 个零件;IoU 增益在三个数据集上幅度相近(0.018–0.024),GMS 与两种采样密度下的中位 Chamfer 距离也一致更优。

消融显示算法式提案贡献最大:去掉它后 MCB 上无效率从 0 升到 0.124,平均分下降幅度与同时去掉两类工具相当;去掉优化器只使平均分下降 0.004–0.006 且无效率保持为 0。 这区分了“提供可继续的封闭实体基础”与“微调已有参数”两类作用,说明在机械零件上能否从有效基座出发比参数精度更关键。 消融在三个数据集的固定 1000 零件子集上进行,预算、限制与模型服务一致,报告了逐零件配对差分的 95% bootstrap 置信区间。

在 CADENA-Bench 上无效率为 0,平均 IoU 0.909、GMS 0.721,优于已发表的 CADENA-RL greedy(0.876、0.670);在 BenchCAD 上体素 IoU 0.968 且无无效预测,高于同为网格输入的 CADENA-RL 0.910。 把同一配置推广到机械零件家族与工业零件家族基准,并给出与图像输入系统及带工具前沿模型的对照。 CADENA-Bench 含 3396 个零件、六个家族;BenchCAD 含 17900 个 CadQuery 程序、106 个工业家族、三个难度层级,IoU 与 GMS 随难度单调下降。

启示与展望

该结果面向以单个零件网格为输入、需要可执行且可编辑 CAD 程序的场景,例如只有扫描件或缺失建模历史的部件;系统在 DeepCAD、Fusion360、MCB 全测试集上以零无效率结束,在 CADENA-Bench 上同样为零,在 CADBench 上 18000 个零件中仅 12 个未得到有效预测。对希望复用该流程的读者,可直接使用其公开代码仓库,并沿用其候选池、受保护最优结果与预算机制;算法式提案在“采样首操作无法得到封闭实体”的零件上最关键,因此对机械零件工作流尤其值得优先配置。评估覆盖几何重建与程序有效性,不涉及原始设计历史、制造意图或工程约束,也不覆盖装配体、公差或经仿真验证的设计。

助手依据不完整的视觉与数值证据做决策,其选择可能受提示、模型行为与当前可见候选影响,因此不保证找到最优重建;参数优化无法纠正不合适的操作序列,保留早期候选也无法弥补从未生成的有用替代方案。搜索步数与时间上限可能终止本可成功的轨迹。消融使用固定预算但限于 1000 零件子集,且未匹配实际消耗的计算量,也未单独隔离助手选择策略的贡献;与其他 CAD 智能体的直接对比仍属未来工作。MCB 上平均 GMS 为 0.766,明显低于 IoU,提示体积匹配不等于表面结构匹配,这一差距值得在机械零件上进一步观察。CADBench 上有效形状率低于 CADFit,原因是 576 个零件超出评估器 30 秒限制,这一成本边界对实际部署的影响仍需读者自行权衡。

来源