测试时计算如何提升表格基础模型:DiagScale 微调与贪心聚合带来稳定增益,上下文构建收益依任务而定
核心概要
该工作沿适配、聚合与上下文构建三条轴线系统研究测试时计算对预训练表格基础模型预测的影响:提出仅训练 0.003-0.03% 参数的 DiagScale 对角查询-键相似度更新,在三个独立预训练骨干上取得与全量微调相当的增益;在 96 种配置池上贪心选择相对默认预测器降低 2.4% 误差,而均匀平均反而增大误差;注意力引导检索在部分大表上改善 TabPFN-3 预测,上下文扩展方法则无一致提升。
Figure 1: Three families of test-time compute modify different components of the inference pipeline. Top: an inference pipeline comprising preprocessing, a frozen tabular foundation model, and combination of predictions across data views. Bottom: context construction changes the conditioning data; adaptation changes model parameters; aggregation changes the prediction pool and the rule used to select or combine its members.
arXiv深度剖析
提出 DiagScale,一种对角查询-键相似度更新形式的适配方法,仅训练 0.003-0.03% 的模型参数,即可在三个独立预训练的骨干上取得与全量微调相当的增益。 相对全量微调,该方法把可训练参数压缩到极小比例,同时保持可比的性能表现,说明适配收益不必依赖大规模参数更新。 在 TabArena 基准上评估现代表格基础模型,并补充 OpenML 的宽表与大规模表实验;增益在三个独立预训练骨干上复现。
聚合效果同时取决于池的构成与选择策略:TabPFN-3 已对同一数据的不同预处理变体做预测平均,继续增加此类预测收益递减;在 96 种配置的更广池上,贪心选择相对默认预测器降低 2.4% 误差,而均匀平均反而增大误差。 把聚合拆解为池构成与选择策略两个维度,并显示选择策略的方向性差异——贪心选择有益、均匀平均有害。 基于 TabArena 基准的系统评估,配合 OpenML 宽表与大规模表实验;给出相对默认预测器的误差变化幅度。
上下文构建方面,注意力引导检索在部分大表上改善 TabPFN-3 的预测,并支持超出完整上下文内存限制的来源池;所测试的上下文扩展方法未带来一致提升。 区分了检索式上下文构建与上下文扩展两类做法,指出前者在特定大表场景有效且可突破内存限制,后者缺乏一致收益。 在 TabArena 与 OpenML 大表上的实验;效果依任务与数据情形而异,未报告跨场景一致增益。
适配与聚合在同一骨干上组合使用时能带来进一步增益,但所需计算显著高于默认推理;这些权衡支持按可用计算预算选择策略。 把三类测试时计算策略的收益与计算代价放在同一框架下比较,给出按预算取舍的实践指引。 综合基准层面的结果,指出适配与选择性聚合带来一致的基准级增益,而上下文构建的收益更依赖任务与数据情形。
启示与展望
该工作面向使用强预训练表格基础模型的研究者与工程实践者,适用于以 TabArena 基准为主、并以 OpenML 宽表与大规模表为补充的评估场景。其结论按可用计算预算组织:适配与选择性聚合在基准层面带来一致增益,二者组合可进一步提升,但计算开销显著高于默认推理;上下文构建的收益更依赖具体任务与数据情形。注意力引导检索在部分大表上有效,并支持超出完整上下文内存限制的来源池,因此对受内存约束的大表场景具有参考价值。
读者仍需关注若干开放问题:上下文构建的收益在何种任务与数据情形下稳定出现,尚需更细粒度的刻画;贪心选择在 96 种配置池上的 2.4% 误差下降是否随池规模与配置多样性变化,文本未展开;适配与聚合组合带来的额外计算量在何种预算下仍具性价比,也留待按部署条件权衡。此外,本次读取为摘要级范围,未包含图表与完整实验细节,因此关于各策略在不同数据情形下的具体表现,仍需查阅原文。
