表格基础模型少看九成样本仍能打:只训一层线性对齐,推理时把中间激活拉回全量上下文
导语
表格基础模型在上下文被压缩到十分之一时,用一个在合成无标签数据上训练的单层线性变换把中间激活拉向全量上下文的教师,在38个分类数据集上多数条件下超过未对齐学生,并恢复教师约一半的预测优势。
正文
表格基础模型的预测质量随上下文样本数下降,而激活对齐让只看到部分样本的学生模型在内部表示上向看到全部样本的教师靠拢,从而在推理时用更少的上下文样本拿到更好的预测。 此前要降低这类模型的推理开销,要么压缩上下文,要么剪掉冗余层,两条路都需要大量GPU训练。 在TabArena的38个分类数据集上,用TabPFN-3和TabFM两个模型评估,对齐后的学生在81%的条件下优于未对齐基线,且统计显著。
对齐器是一个线性模块,它不预测教师激活本身,而是预测学生激活与教师激活之间的残差,权重从接近零开始,因此训练初期不会破坏学生原有表示。 特征蒸馏通常把学到的回归器当作训练期脚手架,学生权重更新后就丢弃,而对齐器保持全部权重冻结,本身就是部署时的推理干预。 训练只用合成无标签查询,在普通CPU上几秒到几分钟收敛,无需GPU;对齐在24层模型的最后一层进行,TabPFN用8个估计器各训一个对齐器,TabFM用单个估计器。
接下来
下一步可以在回归任务上验证同一对齐器是否直接适用,因为它的训练只用无标签合成查询,没有分类特有的假设。也可以把对齐器接到经上下文压缩或层剪枝的模型上,把被压缩扰动的表示拉回全容量教师,从而在保留推理加速的同时找回精度。对检索式上下文选择的学生,同样可以只修正表示而不改输入。
38个数据集中有5个在两个模型上都出现负的平均有效样本增益,目前还没有能事先区分受益与不受益数据集的特征。对齐器训练需要离线访问完整数据集以提取教师激活,因此它解决的是推理时的算力与内存瓶颈,而不是数据本身就很少的情形。方法目前只在分类任务和两个表格基础模型上验证,向回归和其他架构的推广仍是待验证的问题。
