ZeroMAG 用无标签校准信号零样本生成多模态适配器,在六个留出数据集上把冻结 EEG 基础模型的平衡准确率平均提升 7.22 个百分点
相关研究与后续进展核心概要
ZeroMAG 提出一种零样本多模态适配器生成框架:在冻结 EEG 编码器与预测头的前提下,仅用无标签目标校准记录和任务上下文,通过配置不变的 1+N 适配器结构、模态–被试–任务条件,以及从源适配器学到的函数约束隐空间生成适配器权重;在六个留出目标数据集和三个 EEG 基础模型骨干上,其平衡准确率平均比仅 EEG 推理高 7.22 个百分点、比直接权重回归高 4.89 个百分点,平均仅比有监督多模态适配低 0.50 个百分点,且无需目标标签或目标端优化。
Figure 1: Multimodal EEG landscape and representative results. (a) Physiological information captured by common companion signals. (b) Publication trends, task-wise multimodal prevalence, and companion modality availability, based on prior surveys ( Lee et al., 2025 ; Yeung & Chu, 2022 ) . (c) Balanced accuracy on six held-out target datasets, comparing three EFM backbones with and without ZeroMAG against SleepFM and PhysioOmni.
arXiv深度剖析
ZeroMAG 把多模态扩展表述为个性化参数生成:给定无标签目标记录与任务上下文,直接生成目标专属适配器,同时保持 EEG 基础模型冻结。 与需要目标端优化的参数高效微调、测试时自适应,以及需要多模态预训练的多模态生理基础模型不同,这里把适配摊销到一个离线训练的生成器中,部署时只需一次前向生成。 在六个留出目标数据集、三个骨干(CBraMod、CSBrain、CodeBrain)共 18 个骨干–数据集设置中,ZeroMAG 在全部设置上优于仅 EEG 推理、均值源权重、最近源权重和 Direct MLP;平均提升分别为 7.22、6.78、6.00 和 4.89 个百分点。
配置不变的 1+N 适配器把冻结 EEG 表示作为固定锚点,为每个可用伴随模态挂接同构分支(时序–频谱编码、特征投影、共享协调),缺失模态不产生参数块或占位隐 token。 单一生成器即可覆盖异构模态配置,无需按数据集重新设计,也无需预先固定支持的模态集合。 消融显示共享模态编码器降低 4.16 个百分点、仅保留时序分支降低 8.12 个百分点、用均值融合替代学习式协调降低 6.58 个百分点,支持模态特异编码、时序–频谱处理与学习式融合的作用。
模态–被试–任务条件从无标签记录推断目标专属信息,不使用数据集标识符;被试因子由观测记录推断而非检索被试 ID。 仅靠模态信息无法区分同一模态组合下的不同被试生理差异,也无法区分同一生理信息对应的不同任务。 去掉被试因子仅保留任务与模态降低 11.09 个百分点;打乱被试条件降低 9.24 个百分点,尽管表示保持相同的边缘分布与维度。
函数约束的两阶段生成(函数保持表示学习 + 函数约束条件生成)在块对齐隐空间中进行,并以冻结 EFM 下的预测一致性作为监督,而非仅最小化参数误差。 参数重构接近并不保证预测接近;该设计把生成目标从权重空间扩展到预测行为。 去掉 Stage 1 函数监督使重构误差下降 6%,但生成权重误差上升 5%、预测 KL 上升 31%,B-ACC 下降 1.15 个百分点;去掉 Stage 2 函数监督使预测 KL 上升 48%、B-ACC 下降 1.58 个百分点;两者都去掉下降 2.87 个百分点、预测 KL 上升 82%。
启示与展望
该结果面向已提供微调好的 EEG 基础模型与兼容预测头的场景:目标端只需无标签校准信号与已知任务,即可生成即插即用适配器,无需目标标签、伪标签、梯度或迭代优化。评测覆盖睡眠分期、情绪识别、认知负荷、运动想象与冻结步态检测,伴随信号包括 EOG、EMG、ECG、眼动、加速度与皮肤电导;在已知模态的未见组合与未见模态类型上,分别恢复有监督多模态增益的 89.7% 与 82.6%。性能在约 64 个无标签校准窗口处饱和,使用 50% 源适配器库仍保留 97.2% 的全库多模态增益;目标端条件构建与适配器生成约 2 分钟,而有监督目标适配约 15 分钟。方法依赖源适配器库的覆盖度与质量,离线训练成本按目标摊销。
消融中的各变体是分别训练的系统,其下降幅度是相对完整模型的增量差异,而非可相加的因果分解;情绪识别目标 SEED-V 的绝对提升与有监督增益恢复率均低于其他目标,原文未识别这一任务相关差异的来源。跨范式比较中 PhysioOmni、SleepFM 与 Brant-X 使用各自原生骨干与不同多模态学习流程,未隔离骨干架构、预训练暴露或目标适配等单一因素。报告的标准差刻画种子间波动,不是成对差异的置信区间,重叠须状线既不确立显著性也不确立等价性;0.50 个百分点的有监督差距是显示平均值上的小残差,并非形式化等价结论。函数匹配传递的是源参考适配器的行为及其误差,因此不是无监督的正确性证明。校准窗口数描述的是校准单元数量而非统一时长,窗口时长与采样率随任务不同。源适配器库规模与校准预算的联合最优未给出。此外,正文结果表在加载文本中为空,具体逐数据集数值只能依据附录汇总与正文所述平均值理解。
