三目标融合与多分支架构让无线基础模型以约三分之一参数在六个下游任务上超越单目标编码器
相关研究与后续进展核心概要
该工作提出融合MAE、JEPA与SimCLR三种自监督目标表示的框架,并设计共享主干加目标专用分支的多分支架构,在约25000个频谱图与CSI样本上预训练后,于通信、感知与定位六个下游任务中,等输出维度下融合在全部六项任务上优于所评估的单目标编码器且参数约为其三分之一,多分支架构在单编码器参数预算内保留了大部分融合收益,表示分析显示各目标贡献互补且增益多保留在与MAE表示子空间正交的分量中。
Fig. 1 : Representation fusion framework. Three encoders, each pretrained with a distinct self-supervised objective, are frozen and their representations are pooled (mean pooling for MAE and JEPA; [CLS] token for SimCLR) and concatenated to form the fused embedding 𝐳 fused \mathbf{z}^{\text{fused}} .
arXiv深度剖析
三目标融合在等768维输出下于全部六个下游任务上优于所评估的单目标编码器,且参数约为其三分之一。 此前无线自监督工作几乎都绑定单一目标族,最多组合两个目标;该工作首次将重构、预测与对比三个目标族同时融合,并把表示多样性明确作为与宽度扩展对照的扩展轴。 在约25000个样本的异构频谱图与CSI语料上预训练,六个任务覆盖通信、感知与定位,报告了波束预测提升7.5个百分点、定位误差降低0.60米等具体数值,并与256维、512维、768维单目标编码器在匹配输出维度下对比。
多分支架构以共享主干加目标专用分支的方式,在单编码器参数预算内保留了大部分融合收益。 融合需要维护三个独立编码器,参数增至三倍;多分支通过共享早期Transformer块、深层分支专用化,在零参数开销配置下达到768维表示,性能在测试的共享深度范围内保持稳定。 零开销配置在六项任务中的四项上超过最佳768维单目标编码器,参数约为其九分之一,干扰分类提升2.0个百分点;与融合相比分类精度差距在2.7个百分点内,定位误差仅增加0.05米。
表示分析表明三个目标学习到结构不同的表示,且各自贡献非冗余,互补信息多位于MAE表示子空间的正交分量中。 此前工作多停留在性能对比,该工作用CKA、探针权重、留一法与子空间分解给出机制性解释,说明融合增益的来源。 跨方法CKA值在0.52至0.84之间,探针权重无一份额低于23%,留一法显示移除任一编码器至少在六项任务中的三项上造成退化,子空间分解显示正交残差分量保留了几乎全部增益而平行分量增益接近零。
启示与展望
该结果适用于预训练数据有限、下游任务跨越通信、感知与定位的无线自监督场景,尤其是频谱图与CSI两种模态。对希望在不增加参数预算的前提下提升多任务泛化能力的无线系统研究者与工程师,该工作提供了融合框架与多分支架构两种可复现的实现路径,以及CKA、探针权重、留一法与子空间分解等诊断工具,可用于判断自身任务中目标组合的价值。
预训练语料约25000样本且包含私有频谱图数据,结果是否随数据规模扩大而变化尚待验证;多分支在LoS/NLoS与干扰分类上低于最佳单目标编码器,固定参数预算下跨目标分配可能存在权衡;JEPA移除在部分任务上影响甚微,各目标贡献的任务依赖性仍需在更多任务与模态上考察;自适应损失权重与共享分支划分方式仍是开放方向。
