跳到主要内容
返回时间线
arXiv来源发表:

谷歌400M参数TabFM在TabArena全部51个数据集上零样本登顶,冻结权重下TabFM-Auto再提Elo

核心概要

TabFM是一个400M参数的表格基础模型,把监督式表格预测表述为上下文学习,仅用结构因果模型生成的合成表格预训练,在单次前向传播中给出校准的零样本预测;在TabArena全部51个数据集(38个分类、13个回归)上,零样本TabFM在默认表格基础模型中排名第一并超过调优的AutoML流水线,其两个扩展TabFM+(多视图特征扩展、集成与事后校准)和TabFM-Auto(由Gemini-3.8-Flash引导的数据集特定数据处理与特征工程)在冻结权重下进一步提升两个赛道的表现。

AI-generated editorial illustration: TabFM: A Zero-Shot Foundation Model for Tabular Data

深度剖析

TabFM把表格预测重构为一次前向传播的上下文学习:输入层用dyadic特征分组把每列与偏移邻居配对,并通过学习到的Fourier频率库投影单元格值,随后交替使用线性时间的列向Induced Self-Attention Blocks与带RoPE的行向Self-Attention Blocks,用8个学习到的CLS token把任意特征数池化为定宽行表示,再由24层、宽1024的上下文预测器输出结果。 此前上下文表格预测受限于朴素注意力在行与列上的开销,历史上把表格Transformer限制在不到1000行;TabFM通过把特征编码与跨实例推理解耦,把上下文扩展到16,384个实例,比该范式最初被演示的规模高出一个数量级。 论文给出完整架构规格表:光谱投影0.05M、列嵌入ISAB 3.3M、行交互SAB 1.6M、ICL预测器402.7M、预测头1.05M,合计408.7M参数;并说明非对称掩码只允许查询关注带标签前缀,使测试预测在给定上下文下条件独立,避免标签泄漏。

TabFM完全在结构因果模型生成的合成表格上预训练:每个数据集采样一个随机函数依赖的有向无环图,根变量经非线性变换与代数聚合产生混合连续与离散列的表,并联合随机化表形状、类别列占比与基数、缺失值、标签噪声与类别平衡,特征轴上限100列;四阶段课程把上下文从2,048增长到16,384实例,每次切换行数翻倍、批大小减半以保持每步token数不变。 这延续了Prior-Data Fitted Networks用合成先验逼近贝叶斯后验预测的思路,但把随机化与因果图联合起来,使评估表落在预训练分布支撑内,并把预训练目标与推理接口对齐——每张采样表在进入模型前就切分为带标签上下文与查询块,损失只在查询行上评估。 论文明确说明训练数据全部来自SCM合成表,并给出课程各阶段的行数与批大小关系;这是方法描述与设计论证,而非独立的消融实验证据。

在TabArena的51个数据集(38分类、13回归)上,零样本TabFM在两个赛道都领先默认基础模型:回归达到2055.2 Elo,高于EXAONE-Tabular的1973.1、TabPFN-3的1866.6、AutoGluon 1.5 extreme的1851.2与TabICLv2的1723.6,几何平均误差最低为16.40;分类达到1768.6 Elo,高于EXAONE-Tabular的1768.0、AutoGluon 1.5 extreme的1669.7、TabPFN-3的1641.9与TabICLv2的1586.4,几何平均误差最低为0.0957,独占胜场最多为5.54,oracle可改进度最低为6.10%。合并两个赛道后TabFM以1785.4 Elo在默认基础模型中排名第一,对EXAONE-Tabular、AutoGluon 1.5 extreme、TabPFN-3、TabICLv2的逐折胜率分别为65.7%、72.1%、75.9%、79.8%。 相对此前表格基础模型,TabFM的领先在回归上幅度更大,论文将其归因于光谱嵌入把目标放在连续尺度上而非分段常数切分;在分类上前四名落在约130 Elo的区间内,TabFM的优势来自跨数据集更低的遗憾,把oracle可改进度从EXAONE-Tabular的9.47%和AutoGluon 1.5 extreme的10.00%降到6.10%。 评测使用TabArena的重复10折交叉验证,比较池含67种方法配置(调优树集成、调优深度基线、四小时预算AutoML与已发表表格基础模型),评分来自Bradley–Terry拟合,以单个(数据集,折)对为单位、每个数据集等权、Random Forest锚定1000、取100轮bootstrap的中位评分。

两个扩展在冻结权重下继续提升:TabFM+在标准化与列清洗后构造乘法交叉特征池与截断SVD结构特征池,把成员预算一半用于原始列、一半追加随机抽取的工程特征,并对每个成员施加独立视图变换(不同预条件、随机列置换、类别索引双射置换、分类标签循环移位),用非负最小二乘堆叠并在分类上做Platt校准;TabFM-Auto把冻结的TabFM与Gemini-3.8-Flash配对,在封闭程序合成循环中迭代编写、评估、改进围绕预训练模型的Python流水线,每次运行都从恒等程序(原味TabFM)出发,搜索在96次评估或六小时时停止。 TabFM+利用模型对列顺序、数值缩放与追加特征交互敏感这一性质,从同一组权重产生不同内部视图;TabFM-Auto则把改进主要归因于特征构造而非超参数调优,例如airfoil_self_noise上的Strouhal与Reynolds数、Diabetes130US上折叠为章节的ICD-9诊断,按最终程序是否改变表格切分,中位误差下降分别为2.14%与0.27%。 TabFM-Auto以TabFM-Auto 1940.7 Elo、TabFM+ 1838.0 Elo、TabFM 1768.6 Elo占据分类前三,回归为2392.4、2189.2、2055.2;TabFM-Auto改进51个数据集中的41个,在其中40个上胜过推理时集成,回归在全部13个数据集上改进并达到0.00% oracle可改进度,未改进的十个分类数据集测试误差上升最多1.8%。

启示与展望

这项工作面向需要在无任务特定调参下获得可用表格预测的使用者:零样本TabFM在单次前向传播中给出校准预测,适合作为默认基线;TabFM+面向愿意付出推理时集成成本、希望从同一冻结权重榨取更多精度的场景;TabFM-Auto面向允许用LLM在封闭交叉验证循环中合成数据集特定特征工程流水线的场景,其候选程序在沙箱中执行且不接触留出测试折。评测范围是TabArena的51个数据集(38分类、13回归),预训练覆盖合成数值与类别表、最多16,384行与100列。论文给出的下一步包括用层次化行池化与稀疏特征注意力把预训练扩展到百万行与千列、把合成因果先验与真实表格语料及预训练文本和时间编码器结合以支持自由文本字段、时间戳与高基数标识符,以及把架构从单张扁平表推广到关系模式,避免推理前手工连接与展平数据库。

预训练只覆盖最多16,384行与100列的合成数值与类别表,更大表依赖长度泛化或子采样,自由文本字段尚无语义分词编码,这些是论文自己列出的开放方向。TabFM-Auto的完整细节被指向另一篇论文(Fu et al. 2026a),本文只做方法概述,因此其搜索过程与失败模式在本文范围内无法完整核对。分类赛道上前四名落在约130 Elo的区间内,零样本优势主要体现为更低的oracle可改进度,读者可关注这一差距在不同基准与数据分布下是否稳定。TabFM+与TabFM-Auto的增益分别来自推理时集成与LLM引导的特征工程,其成本与收益的权衡需要结合具体部署预算判断。

来源