跳到主要内容
返回时间线
Statistica Sinica来源发表:

Delaunay加权两样本检验:利用几何方向信息在高维流形数据上检测协方差主方向差异

核心概要

作者提出Delaunay加权两样本检验:在低维流形假设下用Delaunay三角剖分定义同时包含测地距离与相对方向的Delaunay权重,以组内Delaunay权重均值作为检验统计量并用置换法计算p值,理论上证明原假设下渐近正态、备择假设下相合,模拟显示在两分布协方差主方向不同时功效显著优于k-NN、k-MST、核检验、e-distance、协方差检验与回归检验,并在小鼠蛋白表达数据上以p=0.011检出药物治疗组差异。

Source-provided article image: Delaunay Weighted Two-sample Test for High-dimensional Data by Incorporating Geometric Information
Figure 1

Figure 1: (a) Graphical illustration of the empty ball property of the Delaunay triangulation with M = R2; (b)–(c) The Delaunay triangulation versus a random triangulation of the same Z.

· 第 9 页

深度剖析

提出Delaunay权重这一新的几何邻近性度量,它基于流形上的Delaunay三角剖分,同时使用测地距离和相对方向信息,而现有核方法、局部回归和k-NN只使用局部距离。 以往相似性度量只利用成对距离,本文的权重依赖于对数映射向量log_{z*_i}(z_j)而非仅其范数,因此即使距离相同、方向不同也会给出不同权重。 定义2给出流形上的形式化定义,并证明在M=R^d时条件(c†)与(c‡)等价;图2与图3的R^2示例显示z2的三个最近邻全部来自右上方,而Delaunay单纯形由z5、z7、z8构成、覆盖各个方向。

构造检验统计量T_DW为合并样本中所有组内Delaunay权重的平均,并给出置换检验流程。 沿用Schilling(1986)k-NN检验的组内邻近性平均思路,但把邻近性度量替换为Delaunay权重,从而把流形结构与方向信息纳入统计量。 式(4)给出T_DW定义;置换步骤中p值取{B个置换统计量中不小于观测值的个数+1}/(B+1),并说明在原假设下该p值在{1/(B+1),…,1}上均匀分布、随B→∞收敛到Unif[0,1]。

给出原假设下渐近正态性与备择假设下相合性的理论结果。 由于Delaunay三角剖分的离散性使无条件方差难以显式表达,作者先在给定Z的条件下推导期望与方差,再证明标准化统计量的渐近正态性。 定理1给出E_{H0}(T_DW|Z)与Var_{H0}(T_DW|Z)的显式表达式;定理2给出渐近正态性;定理3证明对任意显著性水平α∈(0,1)与F≠G,置换检验以渐近概率1拒绝原假设,其证明思路取自Henze and Penrose(1999)。

开发立体投影DELAUNAYSPARSE算法以在未知流形下近似计算Delaunay权重矩阵,并验证方法对流形学习步骤的稳健性。 原DELAUNAYSPARSE算法只能处理位于凸包内的点,作者引入逆立体投影把点映射到球面,使凸包外的点也能找到对应的Delaunay单纯形。 算法复杂度为O(n^{2+1/d}d^2);数值实验显示当η≥15时权重矩阵仅因浮点误差不同,故建议取η=15;敏感性分析中“已知流形”“固定d̂=10=d”“估计d̂”三种实现结果相近,且仅当估计的内在维数低于真值时才损失功效。

启示与展望

该检验面向满足流形假设的高维数据:两个分布支撑在一个d维测地凸Riemann流形M上,M嵌入R^D且d远小于D,并要求样本量大于估计的内在维数。方法在未知流形时通过Isomap式流形学习、Dijkstra测地距离估计与经典MDS获得低维欧氏表示,再用立体投影DELAUNAYSPARSE算法近似权重矩阵,因此可直接用于生物信息学、图像分析与自然语言处理等被认为存在低维结构的数据。真实数据分析中作者采用小鼠层面的置换以控制同鼠细胞相关性带来的第一类错误,说明该方法可扩展到存在分组相关结构的场景。作者还指出可把该检验与核检验或e-distance检验通过Cauchy组合检验结合,以在未知备择类型下获得更稳健的表现,并可将Delaunay权重矩阵用于假设检验之外的统计推断。

在位置差异备择下,该检验的功效低于核检验与e-distance检验,作者也指出其方法在位置差异下并非最高;因此实际应用中备择类型未知时,单一检验的表现取决于差异究竟来自位置还是方向。真实数据中内在维数被估计为3,远小于68个蛋白,但这一估计依赖Algorithm S1,且作者提到同鼠细胞相关性可能在低维表示与Delaunay权重计算中引入偏差、造成功效损失,虽然小鼠层面置换控制了第一类错误。理论结果依赖若干正则条件,包括对Delaunay三角剖分的正则化条件(作者说明若无hub则满足),这些条件在真实数据中是否成立仍需具体判断。作者提出的未来方向——噪声污染数据、不同维数流形并集、以及与其他检验的组合——目前尚未在本文中验证。

来源