跳到主要内容
返回时间线
arXiv来源发表:

TabFM-Auto 用 LLM 智能体围绕冻结的 TabFM 演化数据管线,在 TabArena 全部 51 个数据集上把 Elo 从 1785 提升到 2013

核心概要

TabFM-Auto 把冻结的表格基础模型 TabFM 与一个语言模型编码智能体配对,让智能体依据数据集元数据与验证反馈迭代改写数据清洗、特征工程、上下文选择和后处理四个阶段的管线,在 TabArena 全部 51 个数据集上五种配置占据总榜前五名,最佳配置(Codex 配 Opus 5)把 TabFM 从 1785.3 Elo 提升到 2013.0 Elo,所发现的管线无需再搜索即可迁移到 TabPFN-3、TabICLv2 和 EXAONE-Tabular(提升 69 至 143 Elo),并在 MLE-Bench 的 8 个表格竞赛中在 MLE 智能体里排名第一。

AI-generated editorial illustration: TabFM-Auto: Self-Evolving Pipelines for Tabular Foundation Models

深度剖析

论文提出 TabFM-Auto:保持 TabFM 权重冻结,由 LLM 编码智能体在 3 折交叉验证上迭代编辑四个模块化 Python 函数(preprocess()、engineer()、sample()、postprocess())以及 TABFM_KWARGS 配置字典,从而把列名、单位、任务描述和辅助文件中的语义转成显式管线代码。 此前的 LLM 特征工程方法(如 CAAFE、FeatLLM、OCTree)只向单表追加派生列,TabFM+ 只加入通用的成对交叉特征、SVD 投影和多视图集成,而端到端 MLE 智能体(AIDE、R&D-Agent、MLEvolve)在搜索中同时重训树模型或神经网络;TabFM-Auto 把搜索范围限定在数据管线,预测器始终固定。 论文给出四阶段的形式化目标函数、沙箱隔离与冻结模型校验协议,并报告每个候选管线无需梯度训练、评估快速且没有模型重训噪声;在 51 个数据集上运行了五种智能体与语言模型组合。

在 TabArena 全部 51 个数据集(38 个分类、13 个回归)上,五种 TabFM-Auto 配置占据总榜前五名,最佳配置(Codex 配 Opus 5)达到 2013.0 Elo,高于 TabFM 的 1785.3 Elo 和 TabFM+ 的 1856.0 Elo,也高于 4 小时 AutoGluon 1.5(extreme)的 1668.4 Elo。 论文报告回归任务上提升更大:TabFM-Auto 把 TabFM 提升到 2512.9 Elo,并在全部 13 个回归数据集上都有改进;分类任务上提升到 1966.3 Elo,Antigravity 配 Gemini 3.8 Flash 取得最低 G-Mean 测试误差 0.0902 和最多数据集胜场 16.11。 每个数据集用 fold 0 训练集做一次 3 折交叉验证搜索(最多 96 次评估或单张 H100 上 6 小时),随后在全部官方测试折上冻结评分;论文还报告了 fold 0 单独留出测试集上的排名,以及最多 15 个中间检查点的验证到测试泛化曲线。

论文按列名是否携带真实语义把数据集分为三类并统计智能体写出的特征:在 17 个列名或任务描述指向物理、临床、工程、经济量的数据集上,智能体直接写出领域公式(如 airfoil_self_noise 上的 Strouhal 数、Diabetes130US 上把 ICD-9 编码归入 19 个器官系统章节、MIC 上的休克指数),官方测试误差降低 7.25%(Opus 5)到 8.16%(Gemini 3.8 Flash),约为 34 个匿名或通用表头数据集上降幅的近三倍。 论文把增益来源拆解为领域知识特征、统计与结构特征(如 Amazon_employee_access 上的二部图度数与共现、kddcup09_appetency 上的频次编码与缺失信号、宽表上的共线性剪枝与截断 SVD)以及仅上下文与校准改动三类,并指出 5 次未改动特征表的运行中有 4 次靠上下文采样或先验校准取得改进。 分析覆盖 Claude Code 配 Opus 5 与 Antigravity 配 Gemini 3.8 Flash 在全部 51 个数据集上的最终管线,并给出各类别的平均与中位误差降幅;论文同时报告了逐数据集的官方测试分数表。

论文用消融与迁移实验检验机制:同样使用 Antigravity 与 Gemini 3.8 Flash、6 小时预算但可自由训练任意模型的编码智能体只得到 1468.8 Elo,低于 TabFM-Auto 的 1979.6 Elo;把三个最佳配置的最终管线原样套到 TabPFN-3、TabICLv2 和 EXAONE-Tabular 上,每个模型都优于其默认配置,Claude Code 配 Opus 5 的管线迁移效果最好(TabICLv2 +143.3、TabPFN-3 +130.8、EXAONE-Tabular +88.7 Elo)。 论文据此主张编码智能体与冻结基础模型配对优于无约束端到端训练,并说明所发现的管线携带的是可读的短程序(列级操作、哨兵规则、目标链接函数),而非拟合好的数值参数。 消融使用相同智能体框架、模型与预算;迁移实验在全部 51 个数据集的官方测试折上评分,且只保留上下文长度这一项 TABFM_KWARGS 设置,因为其他模型不支持 NNLS 视图加权、特征交叉和 SVD 特征。

启示与展望

这项工作面向使用冻结表格基础模型做结构化数据预测的研究者与工程团队,适用场景是拥有列名、单位、任务描述或辅助文件等元数据的表格任务,以及训练表超过 TabFM 16,384 行预训练长度或类别严重不平衡的情形。论文给出的可复用路径是把跨数据集收集到的公式、清洗规则、目标变换和关系特征整理成库,用于在新表上以更少评估次数热启动搜索;作者还提出把这些操作纳入预训练以得到模式感知的表格基础模型,并把同一搜索扩展到多表关系数据库。迁移实验表明,管线在只保留上下文长度设置时仍能提升其他冻结表格基础模型,因此结果对希望在不重训模型的前提下改善预测的读者具有直接参考价值。

读者仍会关注:在匿名表头上增益明显变小,说明方法依赖列名与任务描述的可读性;管线搜索需要为每个数据集重复验证评估,论文报告五次 51 数据集扫描约花费 1.76 万美元 LLM API 费用,成本随数据集数量增长;论文指出 fold 0 是唯一完全留出的划分,其余折的测试行与搜索所用训练行存在重叠,因此跨折分数可能被抬高,而 fold 0 单独评估与中间检查点曲线用于检验这一点;少数数据集上误差略有上升,论文将其归因于接近饱和或小样本噪声表。此外,本次加载的是论文全文与外部报道,未包含图表本身的图像内容,因此对图中细节的复述以正文文字描述为准。

来源