跳到主要内容
返回时间线
arXiv来源发表:

把表格基础模型蒸馏成轻量学生模型:在 TabArena 上比调参集成基线高出 57–98 Elo,推理最高提速 21.6 倍

核心概要

该工作研究如何把依赖上下文学习的表格基础模型(TFM)蒸馏为轻量、面向单一数据集的学生模型,提出以完整标注训练集作为教师上下文、仅用教师对真实与合成查询的预测来训练学生的配方,在 TabArena 上学生模型比经过调参与集成的监督基线高出 57–98 Elo 分,在 TALENT 上于 300 个数据集中的 236–258 个上优于匹配的默认学生模型并把主指标中位误差降低 4.0–6.4%,同时相对教师取得 3.0–21.6 倍的中位推理加速。

Source-provided article image: Distillation of Tabular Foundation Models into Efficient Predictors
Figure 1 ·

Figure 1: Constructing supervision for TFM distillation. (Left) We study how to construct teacher supervision for ditillation (RQ1) and whether and how expanding teacher queries improves distillation (RQ2). We find that training solely on teacher predictions generated with the full labeled training set as context achieves the best performance. (Right) Elo versus median inference time per 1K samples on TabArena for default lightweight students, their distilled counterparts, and the TFM teachers, with Elo calibrated jointly over the same 76 configurations as in Section 4 .

arXiv

深度剖析

论文围绕 TFM 蒸馏的两个设计问题展开:如何构造教师监督信号,以及扩大查询覆盖是否有助于蒸馏,并在两个 TFM 与神经网络、树模型两类学生上考察这些问题,最终给出一个有效的蒸馏配方。 此前 TFM 的强预测能力依赖反复对标注数据做上下文条件化,推理代价高;该工作把“教师上下文如何选”和“查询覆盖是否要扩展”作为显式设计维度加以检验,而不是只做常规的知识蒸馏迁移。 证据来自跨两个 TFM 与两类学生架构的系统性比较,摘要报告了由此导出的配方及其在多个基准上的表现,属于方法层面的对照研究。

该配方以完整标注训练集作为教师上下文,并仅用教师对已观测查询与合成查询的预测来训练学生。 与直接使用真实标签或仅用观测查询训练学生不同,该配方把监督信号完全建立在教师预测上,并显式加入合成查询以扩展查询覆盖。 摘要说明该配方是在两个 TFM 与两类学生上考察后得出的,并在 TabArena 与 TALENT 上以统一形式应用,未做逐项改动。

在 TabArena 上,蒸馏得到的学生模型比经过监督训练、调参与集成的对应模型高出 57–98 Elo 分。 这一比较的对照是调参并集成后的监督基线,而非未调参模型,因此提升是在较强基线之上取得的。 摘要给出 57–98 Elo 分的区间,属于基准排行榜式的量化比较。

同一配方原样应用到 TALENT 后,在 300 个数据集中的 236–258 个上改善了匹配的默认学生模型,主指标中位误差降低 4.0–6.4%,并相对教师取得 3.0–21.6 倍的中位推理加速。 该结果说明配方在不同 TFM 与不同学生默认配置之间具有可迁移性,同时把预测性能与重复推理成本之间的权衡量化出来。 证据为跨 300 个数据集的胜出数据集计数、中位误差变化区间与中位加速倍数,覆盖范围较广。

启示与展望

该结果面向需要反复推理的表格预测场景:当同一数据集上要多次调用模型、而教师模型的上下文条件化成本成为瓶颈时,把 TFM 蒸馏为数据集专属的轻量学生模型是合适的做法。配方以完整标注训练集作为教师上下文,并以教师对观测与合成查询的预测作为唯一监督,因此适用于已有标注训练集、且愿意为每个数据集单独训练一个学生的设定。摘要显示该配方在两个 TFM 与神经网络、树模型两类学生上均被检验,并在 TabArena 与 TALENT 上以统一形式应用,说明其设计不绑定单一模型族。对希望降低部署成本、同时保留 TFM 预测水平的工程团队,这一折中路径可直接参考;代码已在摘要给出的链接公开。

本文档为摘要级材料,未包含正文的表格、超参数细节与逐数据集结果,因此合成查询的具体生成方式、教师上下文规模的影响、以及不同学生架构之间的差异只能留待正文确认。摘要报告的是 Elo 分区间、胜出数据集计数与中位误差变化,未给出方差或显著性信息,读者若要判断提升在不同数据规模与特征类型上的稳定性,仍需查看完整实验。此外,蒸馏学生是数据集专属的,跨数据集复用与冷启动场景下的表现如何,摘要未涉及,属于值得关注的开放方向。

来源