OctLLM 用八叉树占用字节作为显式三维语言,在统一多模态模型中同时提升三维生成与理解并保持语言能力
相关研究与后续进展核心概要
OctLLM 把网格转成坐标与深度锚定的稀疏八叉树(S-Octree)占用字节序列作为显式三维语言,并将三维容量放入与预训练权重分离的全秩分支,仅训练约 2.80B 参数;在统一多模态 LLM 中取得最佳三维生成与理解,图像到三维 Inception FID 由 ShapeLLM-Omni 的 38.21 降至 31.58,渲染接地描述评分由 18.14 升至 46.88,同时在 MMLU 与 HellaSwag 上完全复现骨干、GSM8K 相差不到一分。
深度剖析
以八叉树占用字节作为显式三维语言,保留空间局部性与层级结构。 此前三维 LLM 多把形状压成 VQVAE 码本索引或把网格序列化为 OBJ 坐标文本,空间组织不再显式;OctLLM 按 Z 序序列化八叉树,每 8 个占用比特打包为一个字节级网格 token,并随机清空倒数第二层节点及其最细层后代得到 S-Octree。 消融中把 S-Octree 换成 ShapeLLM-Omni 的 1,024 个 VQVAE token、其余设置不变,FID 由 33.10 降至 26.31(降 20.5%),KID 同为 0.80,Sentence-BERT 与 SimCSE 分别由 67.15/68.87 升至 69.47/70.28;该消融在 ShapeNet 飞机子集上完成,作者说明其结果不与完整 Toys4K 评测直接可比。
以 token 路由的双流结构把三维容量放进独立可训练分支,避免改写语言通路。 全参数微调代价高且让预训练权重暴露于三维梯度,LoRA 合并后仍改变语言通路;OctLLM 让网格字节与位置查询 <MASK> token 经过部分解码块中的全秩三维分支,文本与图像 token 走冻结的视觉语言通路,两流共享因果自注意力,网格词表另有独立输入嵌入与输出头。 在 28 个解码块中的 12 个(0 索引层 2、4、6、8、10、12、14、16、18、20、22、24)路由三维分支,新增约 2.80B 可训练参数,约为总量的四分之一、全参数微调更新量的约三分之一;表 2(b) 中 OctLLM 在 MMLU 与 HellaSwag 上与 Qwen2.5-VL-7B 完全一致(64.65、67.44),GSM8K 为 83.01 对 83.54,而 ShapeLLM-Omni 与 LLaMA-Mesh 在 MMLU、HellaSwag 上损失三分之一到一半。
在统一多模态 LLM 家族中同时取得最佳三维生成与三维理解。 此前统一模型在生成或理解一侧存在明显短板;OctLLM 用同一骨干同时读写 S-Octree,生成端用位置感知掩码建模,理解端直接以 S-Octree 为输入。 图像到三维上 Inception FID 31.58、KID 0.56,优于 ShapeLLM-Omni 的 38.21、1.02;文本到三维 Inception FID 45.61、KID 0.98,优于 ShapeLLM-Omni 的 52.36、1.38 与 OctGPT 的 46.40、1.13;PointLLM-200 描述上 GPT-img 为 46.88,高于 ShapeLLM-Omni 的 18.14,GPT-ref 26.61 对 22.27,S-BERT 38.80 对 36.08;作者指出专用生成器 TRELLIS 在多数指标上仍最好,OctLLM 在多数指标上排第二。
稀疏化在保持生成质量的同时降低训练与解码开销。 完整八叉树序列随深度快速增长;OctLLM 利用细层占用冗余,随机清空倒数第二层节点并省略其后代,再由 3D U-Net 补全缺失的细层占用。 示例序列由 3,751 个网格 token 降至 2,297;在相同四张 80GB A100 上峰值显存由 58GB 降至 44GB,每轮时间由 2.17 小时降至 1.37 小时;同一 ShapeNet 飞机协议下完整八叉树模型 FID 27.54、KID 0.83,S-Octree 为 26.31、0.80;补全网络消融中 3D U-Net 加二元交叉熵取得最佳 FID 36.86、KID 1.60。
启示与展望
该工作面向在单一骨干内同时做物体级三维生成与三维理解的场景:几何以六层八叉树、最细 64³ 网格的 S-Octree 占用字节进入模型,生成端由位置感知 <MASK> 查询驱动,理解端直接读入 S-Octree,最终网格由冻结的 TRELLIS 流模型在补全后的稀疏占用坐标条件下解码。训练数据为 Objaverse-XL Sketchfab 子集、HSSD、ABO 与 ShapeNet 的并集,共 195K 资产、585K 指令,补全网络另用 175K 稀疏—完整占用对。对希望在不重训语言骨干的前提下加入新模态、或需要模型同时输出形状与文字描述的研究者与工程团队,这套表示加路由的方案给出了可直接复用的接口;作者已公开源码与权重。
作者在附录 E 列出三点:S-Octree 为变长表示,训练集平均 1,793 个 token,多于 ShapeLLM-Omni 固定的 1,024 个,训练时间与显存随之增加;几何经过 S-Octree 生成与 3D U-Net 补全两次学习预测,上游占用误差可能传播或放大,产生孔洞等伪影;当前不支持外观理解与三维编辑,未来计划加入原生颜色与材质建模并摆脱对外部三维生成器的依赖。此外,消融在 ShapeNet 飞机子集上完成,作者明确说明其结果不与完整 Toys4K 评测直接可比;理解评测中 S-Octree 只编码几何,因此 OctLLM 描述形状与部件结构而不涉及外观,PointLLM 因读取彩色点云在 GPT-ref 与嵌入指标上仍领先。读者可关注变长序列的压缩方式、两级预测的误差控制,以及外观与编辑能力加入后语言保持是否仍然成立。
