跳到主要内容
返回时间线
arXiv来源发表:

TabSieve 用「先选证据再预测」的框架,在 75 个分类表和 52 个回归表上把分类平均提升 2.92%、回归平均提升 4.45%

核心概要

作者提出 TabSieve 这一「先选后预测」框架:给定一张表和一行查询,先选出少量有信息量的行作为证据,再在所选证据条件下预测缺失目标;为支撑该能力,他们用强教师模型从 331 张真实表合成并严格过滤出 TabSieve-SFT-40K 训练数据,并提出 TAB-GRPO 强化学习方案,用分离的奖励联合优化证据选择与预测正确性,并通过动态任务优势平衡稳定混合的回归与分类训练;在 75 张分类表和 52 张回归表的留出基准上,TabSieve 在各 shot 预算下持续提升,相对次优基线平均提升分类 2.92%、回归 4.45%,分析显示模型把更多注意力集中在所选证据上,从而对噪声上下文更稳健。

Source-provided article image: TabSieve: Explicit In-Table Evidence Selection for Tabular Prediction
Figure 1 ·

Figure 1: We contrast three prediction paradigms. Traditional models cannot explicitly interpret how context is used. Strong LLMs with in-context prompting can be distracted by noisy context . TabSieve first performs evidence selection and then conducts noise-filtered reasoning to produce the final prediction .

arXiv

深度剖析

TabSieve 把表格预测中的证据使用显式化:先选出一小部分有信息量的行作为证据,再以这些证据为条件预测缺失目标,使证据使用可审计。 既有表格模型通常做逐实例推理,基于 LLM 的提示往往脆弱,模型不能稳定利用相关行,噪声上下文还会拉低性能;TabSieve 把「选证据」与「做预测」拆成两个显式步骤。 论文以「select-then-predict」框架描述该方法,并在留出基准上验证其效果;摘要未给出选择步骤的具体算法细节。

作者构建了 TabSieve-SFT-40K:用强教师模型从 331 张真实表合成高质量推理轨迹,并经过严格过滤。 该数据集为「先选证据再预测」这一能力提供了监督信号,使模型能够学习显式的证据选择行为。 数据来源为 331 张真实表,合成过程使用强教师模型并施加严格过滤;摘要未披露过滤标准与轨迹规模的具体构成。

作者提出 TAB-GRPO 强化学习方案,用分离的奖励联合优化证据选择与预测正确性,并通过动态任务优势平衡稳定回归与分类的混合训练。 相比只优化最终预测正确性的做法,该方案把证据选择本身也作为优化目标,并针对回归与分类混合训练的不稳定问题给出处理方式。 摘要给出奖励分离与动态任务优势平衡的设计描述,未给出消融数值或各奖励项的权重细节。

在 75 张分类表和 52 张回归表的留出基准上,TabSieve 在各 shot 预算下持续提升,相对次优基线平均提升分类 2.92%、回归 4.45%;进一步分析显示模型把更多注意力集中在所选证据上,对噪声上下文更稳健。 提升覆盖不同 shot 预算,说明收益不依赖单一上下文规模;注意力分析把性能提升与「证据被真正使用」联系起来。 基准规模为 75 张分类表与 52 张回归表,报告的是相对次优基线的平均增益;摘要未给出方差、显著性检验或逐表结果。

启示与展望

该工作面向以表格为输入、需要预测缺失目标的场景,适用于分类与回归两类任务,并在不同 shot 预算下评估。它使证据使用变得显式且可审计,因此对需要解释「模型依据哪些行做出判断」的读者最有价值;同时,把证据选择与预测正确性分开优化,也为后续在混合任务类型上训练表格模型提供了可复用的配方。

摘要未披露证据选择的具体算法、TabSieve-SFT-40K 的过滤标准与轨迹构成、TAB-GRPO 各奖励项的权重与消融结果,也未给出逐表结果、方差或显著性检验;注意力分析的具体度量方式同样未在摘要中说明。这些是读者在阅读全文时仍会关注的问题。

来源