跳到主要内容
返回时间线
arXiv来源发表:

无需知道协变量分布:新随机逼近估计量在协变量缺失的逻辑回归中达到参数速率,并证明其风险优于完整案例法

相关研究与后续进展

核心概要

作者针对协变量分布未知(仅有界)且协变量按坐标独立缺失(MCAR)的逻辑回归,构造了一个基于单调算子的无分布估计方程,并用投影随机逼近算法求解;理论上证明该估计量以参数速率恢复信号,其风险由缺失概率向量刻画,始终不劣于完整案例估计量,且在均匀缺失下给出与上界匹配的极小极大下界,说明对缺失概率的非标准依赖是问题固有的。

Source-provided article image: Assumption-lean logistic regression with missing covariates
Figure 1 ·

As an illustration of the difficulties in this problem, Figure 1 considers a well-specified logistic model with bounded, non-Gaussian covariates in dimension d and independent coordinate-wise homogeneous MCAR missingness in which each coordinate is observed i.i.d. (and independently of the data) with probability q. We consider two settings, viz. (d, q) = (10, 0.40) and (100, 0.85); full details of this experiment are provided in Section C.

arXiv · 第 4 页

深度剖析

提出一个不建模、不插补协变量分布的估计方法:在总体层面构造单调算子,使其唯一零点为真实回归参数,再用每个不完整观测构造该算子的无偏估计,嵌入投影随机逼近算法。 既有方法依赖已知或可估的协变量分布(插补、EM、高斯工作模型),在非线性逻辑回归中即使样本量很大也可能不一致;该工作把问题写成无分布估计方程,并利用指数项按坐标可乘分解来构造无偏估计。 论文给出总体算子的强单调性与零点性质(Lemma 5)、经验算子的条件无偏性与方差控制(Lemma 6),并据此证明有限样本上界(Theorem 1);图1的模拟显示插补与高斯似然方法在非高斯有界协变量下不一致,而所提算法接近完整数据MLE。

给出非渐近风险上界,其缺失惩罚由观测概率向量通过一个优化问题刻画,并证明该估计量在所有情形下都不劣于完整案例估计量。 完整案例法只保留完全观测样本,其缺失惩罚约为各坐标观测概率乘积的倒数;该上界表明所提方法的缺失惩罚不会更高,且在均匀缺失的高维情形可显著更低。 Theorem 1 在坐标级MCAR、有界协变量与曲率条件下给出参数速率(随样本量按 1/n 缩放)的界;Corollary 2 与 Corollary 3 在均匀缺失下把界整理为三种依赖于维度、曲率与观测概率相对大小的情形。

建立极小极大下界,在均匀缺失且曲率受限的情形下与上界在指数上匹配,说明对缺失概率的非标准依赖是本质的。 线性回归中缺失惩罚通常为观测概率乘积的倒数量级,而逻辑回归的上界呈现三种不同机制;该下界证明这种更复杂的依赖无法通过更好的估计量消除。 Theorem 4 在样本量条件(式25)下给出下界,其证明结合两个 Assouad 构造:一个刻画完全观测问题的固有难度,另一个用布尔函数(多数函数)的傅里叶系数设计耦合,使观测数据似然比在观测到的辅助协变量过少时恰为1,从而隐藏参数扰动。

启示与展望

该结果适用于响应始终被观测、协变量按坐标独立缺失且观测概率已知的 MCAR 机制,协变量有界且模型为正确设定的逻辑回归,参数位于有界集合内。在此设定下,方法可直接用于在线或流式场景:每次迭代只需一个不完整样本,且不需要估计协变量分布。对实践者而言,这意味着当完整案例稀少(例如维度高或观测概率低)时,可以避免丢弃不完整样本,同时保持参数速率;均匀缺失下的显式常数与三种机制划分也便于判断何时相对完整案例法有实质收益。

上界与下界的匹配在均匀缺失且曲率受限的情形下成立,异质缺失下只有上界;下界带有样本量条件,作者说明该条件恰好对应上界非平凡的区域。方法假设观测概率已知、协变量有界、模型正确设定,且未处理稀疏或其他低维结构、误设模型、MNAR 或更一般的非线性回归,这些被列为开放问题。模拟仅覆盖一个非高斯有界协变量的设定与两种缺失概率,因此实际表现仍需在更多数据生成机制下检验。

来源