Hyvärinen 论证无监督学习没有单一目标,并提出四个彼此正交甚至相互冲突的目标
核心概要
该文论证无监督学习(含自监督学习)不存在单一目标或单一被最大化的目标函数,并提出四个彼此不同、部分正交甚至相互冲突的目标:估计数据分布、生成新数据点、为下游任务提取特征、以及理解数据;作者对每个目标给出问题表述、代表性方法与验证方式,并指出理解数据这一目标依赖可辨识性,而验证本身往往最为困难。
深度剖析
论文主张无监督学习是一个异质领域,无法在概念层面指出单一目标,更不存在单一被最大化的目标函数;这与监督学习最大化预测精度、强化学习最大化总回报形成对照。 相对于把无监督学习视为单一问题的通常做法,作者明确把“目标不唯一”本身作为论点提出,并指出各目标之间可能正交甚至相互矛盾。 属于概念性论证文章,依据是对已有方法(核密度估计、score matching、噪声对比估计、normalizing flows、GAN、扩散模型、自编码器、对比学习、ICA、因果发现等)的归类与逻辑分析,而非新的实验或基准结果。
作者提出四个目标:估计分布、生成新数据点、为下游任务提取特征、理解数据;其中估计分布与生成需要非线性函数逼近器,但该逼近器可以是完全黑箱,因此与提取特征和理解数据在概念上正交。 在 Theis 等(2016)从评估生成模型角度涉及的类似目标之外,作者补充了“理解数据”这一目标,并强调目标之间可能相互妨碍。 论证基于对方法族的结构性分析,例如指出 GAN 直接学习生成而不做密度估计,以及 VAE 等潜变量模型也能生成但结果未必有竞争力。
论文把验证问题按目标分别讨论:密度估计的目标函数值通常缺乏直观解释,只能用于架构间比较;生成数据的验证缺乏通用度量,inception 分数受限于有标注基准的领域,判别式度量在 GAN 中已被优化且依赖网络架构与训练过程。 把“如何验证”与“追求哪个目标”绑定起来讨论,指出同一方法在不同目标下的评价标准不可互换。 依据对既有验证实践的梳理与逻辑分析,未报告新的定量实验。
论文强调可辨识性是“理解数据”这一目标的关键:许多常用特征提取方法只把特征确定到线性变换,VAE 等非线性模型的特征仅定义到正交变换甚至更强的不确定性,因此解释性存疑;而线性 ICA 借助非高斯性、以及借助时间依赖或非负性的方法可提供可辨识解。 把可辨识性作为区分“提取特征”与“理解数据”两个目标的判据,并指出前者对可辨识性的要求可能低得多。 引用线性 ICA、非线性 ICA 与因果发现等既有结果作为支撑,属于文献综合与概念论证。
启示与展望
该框架面向以实值向量数据为对象、采用概率视角并假设样本独立同分布的基本情形,作者也说明该假设可以放宽。它适用于需要为具体任务选择无监督方法并设计相应验证的研究者与工程实践者:先明确追求的是四个目标中的哪一个,再据此选择方法(例如需要解释时优先考虑可辨识的线性或非线性成分模型,需要生成时考虑采样方法)并选择与之匹配的评价标准。作者同时指出该清单并非穷尽,因果发现、数据压缩、数据修复或清洗等都可能构成额外目标,因此该框架更适合作为讨论与分类的起点,而非封闭的分类法。
读者仍需留意:四个目标的清单被作者明确称为暂定且可能不完备,因此不同研究者可能给出不同划分;目标之间“正交”与“相互矛盾”的判断属于概念层面的论证,其边界取决于具体方法与数据;验证问题在生成数据与理解数据两个目标上被描述为困难,文章未给出通用解决方案;此外,密度估计是否应被视为独立目标,作者本人也提出了可争议之处。
