Architect-Ant 用 505 张真实专业户型图训练出可编辑家具布局,功能完整度 94%、碰撞与越界各 0.6%
核心概要
该工作构建了 AntPlan——505 张真实专业住宅户型图、92 类家具、十个房间类别的密集标注数据集,并提出 Architect-Ant:以可编辑坐标 DSL 表示布局,先对 Gemma-4-31B-it 做 LoRA 监督微调,再用房间感知的 Layout Rule Score(LRS)作为最终布局奖励做 GRPO 强化学习;在 109 个 SceneSmith 房间壳上,其平均功能完整度 94%、LRS 8.80、碰撞率与越界率各 0.6%,均优于所比较的基线,且推理约 95.4 秒/房间,快于迭代式智能体方法。
深度剖析
AntPlan 提供 505 张真实专业建筑户型图,含结构、房间与家具标注,覆盖 92 个家具类别和十个住宅房间类别,平均每张图 53.01 个标注对象。 相较既有 2D 户型数据集(如 CubiCasa5K 的 10 个粗粒度家具类、FloorPlanCAD 的 30 类),AntPlan 直接在真实专业图纸上做密集细粒度家具标注,显著扩展了家具类别覆盖。 论文以表格对比了 MSD、ResPlan、ZInD、FloorPlanCAD、SESYD、CubiCasa5K 与 AntPlan 的规模、风格、结构元素、房间类别与家具类别;标注流程为 RT-DETR-X 检测器加人工复核,作者明确将复核后的家具标注视为伪标签。
Architect-Ant 用坐标 DSL 表示布局,先监督微调再以 LRS 为最终布局奖励做 GRPO,无需预设推理轨迹即可生成约束感知布局。 既有方法或只用布局数据、或只用显式约束、或只用预训练模型知识;Architect-Ant 在训练阶段同时纳入三者,并把几何与功能约束转成结果级奖励,而非监督中间推理步骤。 论文给出 SFT 与 GRPO 的完整配置(LoRA rank 64、5 个 epoch、15 次 GRPO 更新、每房间 16 个采样、8 房间一批共 128 条 rollout),并在 243 个留出 AntPlan 房间上比较 base、SFT 与 SFT+GRPO 的 LRS。
在 109 个 SceneSmith 房间壳的对比中,Architect-Ant 取得最高平均功能完整度 94% 与最高 LRS 8.80,碰撞率与越界率各 0.6%,同时每房间平均家具对象数最多。 相比 Holodeck、LayoutGPT、LayoutVLM、SceneSmith 以及 ATISS、InstructScene、DiffuScene,它在保持低几何违规的同时没有靠稀疏布局换取合法性。 论文报告房间级均值,并说明 COL+ 经类别感知过滤、OOB 用表面采样测试、FUN+ 按房间功能槽位计算;同时给出可通行配对率 97.2%,与最佳方法 Holodeck 的 99.5% 相差 2.3 个百分点。
两个视觉评判模型在 109 个共享房间壳上更偏好 Architect-Ant 的渲染结果:Claude Sonnet 5 在 72 个房间中偏好它,Kimi K3 在 74 个房间中偏好它。 这为几何与功能指标之外补充了视觉偏好证据,且 LRS 的总体均值(8.80 对 8.44)与评判模型的总体偏好方向一致。 论文说明评判使用匿名 A/B 渲染图、随机化位置、统一提示词,并指出这是自动化视觉偏好而非人类用户研究,且每个配对只呈现一种顺序,未测量顺序敏感性。
启示与展望
该结果面向住宅室内设计、地产可视化与 3D 场景构建场景,适用于卧室、浴室、厨房、客厅四类房间;AntPlan 与训练好的适配器为后续在更多对象类别、更丰富几何与更细致空间关系上的扩展提供了起点。LRS 作为训练与候选选择的规则评分,也可作为同类布局生成方法的可复用评估代理。
LRS 只覆盖其规则编码的几何与功能属性,不衡量美学,也不保证完整的 3D 可用性;作者报告在厨房推理分支中,保留布局的墙体重叠违规比例从 30.2% 升至 37.0%,且厨房 SFT+GRPO 推理分支的样本排除率达 54.0%,说明高分与生成可靠性需要并读。参考布局的 LRS 均值为 8.73、中位数为 10,而 Architect-Ant 的 8.80 来自不同的房间总体,因此不能据此推断其设计质量优于专业设计。视觉偏好研究为自动化评判、每对仅一种呈现顺序,且整屋比较来自不同户型与不等规模候选池。此外,SceneSmith 的 1,555 秒为按对象数归一化的估计而非实测重跑,时间比较不构成硬件归一化的加速结论。
