跳到主要内容
返回时间线
arXiv来源发表:

LinSlot用线性表示假设把槽表示拆成物体与属性,DCI与FG-ARI优于基线

核心概要

LinSlot 提出一个连接图像、槽(物体)与块(属性)的概率生成模型,把线性表示假设同时施加在物体与属性表示空间,并用块注意力从槽中推断属性;在 CLEVR-Easy、CLEVR-Hard、CLEVR-Tex 上,其 DCI 与 FG-ARI 优于槽注意力、SLATE+ 与 SysBinder 等基线,同时给出槽空间存在全局 delta 方向的证据。

Source-provided article image: LinSlot: Exploiting Linear Representation hypothesis for unsupervised attribute discovery from slot based object representation

(a) Generative model.

arXiv

深度剖析

论文提出一个三步生成模型:先为每个物体的每个因子采样概念索引与概念值(概念先验为正态分布,使每个因子的分布成为高斯混合模型),再把物体表示写成因子表示的线性求和,最后由物体表示生成图像。 此前的块-槽注意力方法假定物体表示可均匀分解为属性,本文改为用线性表示假设给出这一线性组合的生成式依据,并据此推导出可优化的 ELBO。 生成过程与联合分布以公式形式给出,ELBO 的完整推导放在附录 A.2,训练目标由重建项、槽正则项与块正则项三部分构成。

在生成模型与分段仿射等假设下,论文给出块(属性)的可辨识性结论:给定槽固定,块可辨识到平移与置换。 这为无监督属性发现提供了理论刻画,而不只是经验性的解耦效果。 证明思路是把槽的生成写成线性高斯模型,引用 Kivva 等人的可辨识性定理,再通过混合分量数的矛盾论证变换矩阵必须是块置换矩阵。

论文在四个数据集与四种槽方法上测量同一 delta 方向的两组估计之间的余弦相似度,发现同因子 delta 方向的相似度一致高于不同因子之间。 这被作者称为首次在槽空间展示线性表示假设,且该趋势跨数据集与跨槽方法成立,包括使用预训练扩散解码器的方法。 表 1 给出具体数值,例如 CLEVR-Easy 上槽注意力为 0.6610 对 0.2232、SLATE+ 为 0.7465 对 0.1647;MOVi-C 上 CODA 绝对值较低,作者归因于槽推断中的过分割或欠分割。

LinSlot 与使用块解码器的 LinSlotB 在 CLEVR-Easy 与 CLEVR-Hard 上的 D、C 与 FG-ARI 分数优于全部基线,在 CLEVR-Tex 上 D、C 与最佳方法持平,且两种方法的方差低于其他基线。 该框架不需要专用解码器,也不需要块-槽注意力所需的大量超参数调优,同时属性发现与物体发现同时改善。 结果以 DCI 与 FG-ARI 曲线呈现;消融显示去掉两阶段训练或去掉混合槽解码会明显影响 D 与 C,两者都去掉会导致训练崩溃,而模型对 GRU 与 MLP 的选择不敏感。

启示与展望

该框架面向无监督的静态多物体图像,适用于以槽注意力为基座、需要属性级解耦与可解释编辑的场景;由于槽后验可独立实现甚至预训练,块发现模块不绑定特定槽方法,便于替换不同解码器。作者指出未来工作包括端到端可辨识性、扩展到视频,以及对全局属性与物体交互的显式建模。

模型未显式表示背景以及光照、风格等全局属性,作者将其视为不确定性来源。可辨识性结论依赖分段仿射等假设,且以槽固定为前提,端到端可辨识性仍待解决。表 6 中稳定秩与参与率的具体数值在正文中未列出,因此因子子空间维度的定量结论只能依据文字描述。此外,线性性证据来自合成基准与 MOVi-C 帧,向真实复杂场景的推广仍需进一步观察。

来源