跳到主要内容
返回时间线
arXiv来源发表:

Retro 通过回溯推理让表格基础模型提前并分散预测修正,在 TabArena、TALENT、RelArena 上进入前三

核心概要

作者逐查询追踪 TabICLv2、TabPFN-3 与 EXAONE-Tabular 的逐层预测变化,发现预测修正高度不均且常集中在后段;据此提出回溯推理并构建 Retro,用 Attention Residuals 自适应重加权不同深度的中间贡献、用查询条件门控注意力逐维调制上下文更新,使修正提前且更分散,在 TabArena、TALENT、RelArena 上总体 Elo 进入前三并位于性能—成本帕累托前沿。

Source-provided article image: Thinking in Depth: Retrospective Inference for Tabular Foundation Models
Figure 1 ·

Figure 1: Retro lies on the Pareto frontier of three mainstream benchmarks.

arXiv

深度剖析

在样本层面刻画了强表格基础模型的逐层预测动态:用固定于末层的线性读出追踪每个查询的真实类概率间隔,发现修正高度不均,TabICLv2 最后三分之一深度贡献了 84.4% 的绝对间隔移动,TabPFN-3 为 51.5%,EXAONE-Tabular 为 61.1%。 此前工作多在表示层或层级别用探针与层干预分析冗余与非均匀贡献,这里改为追踪单个查询的预测状态变化,把“哪些查询在何时被改写”作为设计依据。 在 38 个 TabArena 分类数据集的第一个官方划分上,对三个模型使用同一套交叉拟合支持表示与冻结读出;统计覆盖全部查询行并按数据集等权平均,视觉案例为示意。

提出回溯推理并实例化为 Retro:Attention Residuals 让后续阶段按行自适应重加权初始编码与已完成两层组的更新和,查询条件门控注意力在输出投影前逐维调制注意力输出,使预测修正提前且分布更广。 标准残差栈中早期贡献只能作为累积状态的一部分影响后续预测,无法被独立选取;Retro 把中间贡献保留为可单独加权的来源,并额外控制新上下文信息如何改写每个查询。 在相同冻结读出下,无门控回溯变体的平均每步正确性翻转率为 24.66%(TabICLv2 为 9.82%),至少翻转一次正确性的查询占 79.5%(TabICLv2 为 63.8%),早期运动占比 60.7%(TabICLv2 为 15.6%),在 38 个数据集中的 36 个上更高;末层冻结读出准确率为 87.5% 对 87.3%。

门控干预显示模型更依赖上下文更新的方向而非幅度:把每个查询的门替换为未标注查询批次的通道均值门后,分类平均准确率下降 0.719 个百分点;仅替换方向损失 0.616 个百分点,仅替换幅度损失 0.0011 个百分点,配对差为 0.618 个百分点(95% 区间 [0.173, 1.217])。 这说明门控不只是整体缩放注意力输出,而是改变更新的几何方向,为查询条件调制提供了机制层面的证据。 覆盖全部 51 个 TabArena 数据集(38 分类、13 回归)的第一个官方划分,使用全部支持与查询行、单视图、FP32 推理、无集成,数据集等权,95% 区间来自 20,000 次配对数据集自助重采样;分类效应异质,中位数为 0.126,23 个数据集偏向保留方向、7 个偏向保留幅度、8 个持平。

在三个基准上评估 Retro:总体 Elo 在 TabArena 排第三、TALENT 排第二、RelArena 排第一,并在各基准上位于估计的性能—成本帕累托前沿,推理时间相对 TabICLv2 几乎不变。 相对其骨干 TabICLv2,Retro 在 TabArena 与 TALENT 的总体排名更高;消融中同时启用两种机制的 Elo 点估计为 1115.6,高于仅 Attention Residuals 的 1093.1、仅门控注意力的 969.0 与两者皆无的 822.3。 TabArena 含 38 分类与 13 回归数据集(594 与 222 个官方划分),TALENT 含 200 分类与 100 回归数据集,RelArena 含 12 分类与 9 回归任务;对比池分别为 37/38/39、17、10 个方法,各基准 Elo 未跨基准校准,消融使用独立对比池。

启示与展望

该结果面向使用预训练表格基础模型、以标注支持集作为上下文进行推理的场景,适用于分类、回归与关系型预测;Retro 沿用 TabICLv2 的合成任务生成器、预处理与推理流程,分类与回归分别训练并使用各自的目标嵌入与输出头,因此其收益是在这一骨干与训练配方下测得的。回溯访问通过两层分组保留初始编码与已完成组的更新和,而非每个完整隐状态,聚合模块新增 24,576 个参数,门投影约 3.15M 参数,聚合与门控的额外计算分别为与量级,可与支持集条件注意力与前馈计算并行考虑。对希望在不显著增加推理时间的前提下改进表格预测的工程读者,可直接借鉴“保留中间贡献为可单独加权来源”与“逐维调制上下文更新”这两项设计。

冻结读出衡量的是预测信息相对于一个共同末层决策规则的表达,而非每个表示所含的全部信息,因此它用于比较逐层修正模式;不同模型的深度索引对应各自的原生块,计算量并不等同。门控方向效应在分类任务间异质,中位数为 0.126,个别数据集上方向替换反而更不有害,因此其普适程度仍需在更多任务与骨干上观察。门交换实验显示邻域约束交换的扰动更小,这与样本条件更新的局部连续性一致,但并未确立这些邻域具有不同语义角色。各基准的 Elo 未跨基准校准,TALENT 的区间反映数据集顺序变异而非评估种子不确定性或自助置信区间,因此跨基准的排名高低应结合各自对比池解读。此外,正文中若干公式、图号与部分数值在解析文本中未完整呈现,若需复现具体实现细节,仍需查阅原文附录中的递推式与完整表格。

来源