跳到主要内容
返回时间线
arXiv来源发表:

把EEG掩码几何当作唯一变量:58个预训练模型显示中等空间半径加短时窗最优,并暴露JEPA特有的偏置膨胀坍缩

核心概要

该研究把EEG自监督预训练中的掩码策略统一为空间半径、时间长度与掩码比例三参数框架,在固定REVE-Small骨干与同一预训练语料下用MAE和JEPA两种框架各训练一组模型(共58个),在OpenEEGBench的12个数据集上用线性探针评估,发现两种框架一致的最优掩码为中等空间半径配短时间块,并识别出JEPA在“全通道”掩码下特有的偏置膨胀坍缩失效模式。

AI-generated editorial illustration: What masking geometry works best for EEG foundation models?

深度剖析

论文提出一个三参数(空间半径、时间长度、目标掩码比例)的掩码形式化框架,把文献中随机patch掩码、整通道掩码、连续时间窗掩码与时空块掩码统一为同一族中的边界情形与连续插值。 此前每个新EEG基础模型都把新的掩码策略与新的骨干、语料和目标捆绑在一起,掩码从未被单独消融;该框架首次让这些形状在同一参数化下可比。 形式化定义加掩码采样算法,并在附录中用模拟验证实际掩码比例与目标一致、经验与理论token距离分布吻合。

MAE与JEPA在最优掩码上一致:中等空间半径配短时间块;同时共享三类失效模式——单通道块、全通道块以及多数长时间块。 这是首次在固定流水线下跨两种自监督目标复现同一掩码结论,说明最优几何不是某一目标的偶然产物。 58个预训练模型、12个OpenEEGBench数据集、5个随机投影种子的线性探针,并用两层bootstrap做统计检验。

在失效模式之外,下游性能对具体掩码选择不敏感:11个MAE配置与9个JEPA配置与各自框架最优在统计上不可区分;框架内差距(MAE与JEPA)大于最优处的跨框架差距。 把“掩码是主导杠杆”与“工作区内可自由选择”区分开,为实践者给出可操作默认值而非单点最优。 基于数据集内排名与成对支配概率的层级bootstrap,报告了框架内最好与最差的归一化分数差。

识别出JEPA特有的“偏置膨胀坍缩”:当同一时间patch的所有通道被一起掩蔽时,编码器收敛到仅依赖位置的查表解,逐通道特征均值膨胀而输入驱动残差收缩,且标准坍缩检测器(逐维方差、损失发散、平凡常数坍缩)均不触发。 该失效模式在既有文献中未见记载,且与低秩型坍缩不同——有效秩反而上升,因此基于秩的探针也会被欺骗。 在physionet与bcic2a上跨预训练epoch测量偏置与残差幅度、通道内余弦相似度,并在5名受试者上复现;附录给出机制分析与被排除的假设。

启示与展望

该结果面向以掩码预测为预训练目标的EEG基础模型实践者,适用于临床EEG与BCI范式为主的预训练语料,并已在REVE-Small之外的CBraMod与LaBraM骨干上验证推荐几何的迁移。它给出的是“先定掩码、再扩算力”的工作顺序:在固定预算下,一个糟糕的掩码最多可损失归一化分数。对使用JEPA类目标的团队,可直接采用的规则是不要同时掩蔽同一时间patch的所有通道,并优先选择中等空间半径。

核心网格只用一个骨干和一个预训练语料,向其他语料、超参数与消费级EEG的迁移仍待建立;掩码比例在核心网格中固定,比例与几何存在交互,完整的联合扫描尚未完成。12个下游数据集中PhysioNet-MI属于预训练语料,其余11个未见;OpenEEGBench与其他近期EEG基础模型的预训练语料存在重叠,集体基准过拟合无法排除。偏置膨胀坍缩的机制解释中,VICReg类正则化是否真能阻止该解、以及分布型正则化(如SIGReg)能否排除查表不动点,均未做实证检验;可靠的训练中检测器也尚未构建。此外,本次加载的文本中部分表格数值以占位形式呈现,因此具体分数与算力数字无法在此逐项核对。

来源