跳到主要内容
返回时间线
arXiv来源发表:

张智恒提出波动监督预训练FSP:在24个非线性连续协变量单元中把宏平均RMSE较S-learner降低7.0%,并在效应漂移下较潜效应监督降低54.2%

核心概要

该工作提出波动监督预训练(FSP):用平均处理效应加上其有效影响函数波动来标注每张合成表,部署时仍是一次冻结前向传播;作者证明在路径 T_{λ,P}=θ(P)+λP_nψ_P 上存在端点转变——任何固定 λ<1 都保留量级为 (1-λ)^2/n 的标签模糊性,而完整波动使高斯标签可观测并把最优有限分层因果标签预测风险降到 n^{-2} 量级;实验显示在训练上下文长度下、24个非线性连续协变量单元中,连续行FSP把检查点平均宏RMSE较S-learner降低7.0%并赢下全部12个弱重叠单元,验证集选出的Summary FSP在单线程热启动基准中每表部署快11.6倍,效应漂移下匹配的Raw FSP较潜效应监督把平均

Source-provided article image: Learning to Fluctuate: Statistical Foundations for Causal Tabular Pretraining
Figure 1 ·

Figure 1 : Teach the sampling response once, reuse it across new tables. Panel a shows why latent-effect supervision can have the wrong repeated-sampling center under prior shift; Panel b shows that FSP moves EIF structure from per-dataset correction to reusable synthetic supervision; Panel c shows why the full-fluctuation endpoint is statistically special and how finite pretraining error propagates into inferential guarantees.

arXiv

深度剖析

论文提出波动监督预训练(FSP),把每张合成表的标签设为平均处理效应加上其有效影响函数波动,部署阶段保持为一次冻结前向传播。 相对于以潜效应为监督、从而奖励后验收缩的因果表格基础模型做法,FSP改为编码固定部署总体所需的重复抽样响应。 这是论文摘要中明确陈述的方法设定,并配有沿路径 T_{λ,P}=θ(P)+λP_nψ_P 的理论刻画。

作者证明端点转变:每个固定 λ<1 都保留量级为 (1-λ)^2/n 的标签模糊性,而完整波动使高斯标签可观测,并把最优有限分层因果标签预测风险降到 n^{-2} 量级。 该结果把标签构造的选择与可达到的风险阶联系起来,而不只是给出经验比较。 属于论文给出的理论证明;摘要同时给出互补下界,把局部 n^{-1} 的ATE风险与通用有限字典回合学习的 log N/M 超额风险区分开。

论文给出有限预训练界,把标签误差、网络误差、回合采样误差与优化误差合并,其采样缺陷控制固定机制偏差、均方误差、方差、高斯近似,并在方差头准确时控制学生化覆盖率。 这把预训练误差分解与下游因果推断性质(包括覆盖率)联系起来。 摘要陈述的界与下界;已知效应半合成实验用于检验覆盖率。

实验追踪学到的抽样响应:在训练上下文长度下、24个非线性连续协变量单元中,连续行FSP把检查点平均宏RMSE较S-learner降低7.0%并赢下全部12个弱重叠单元;验证集选出的Summary FSP在单线程热启动基准中每表部署快11.6倍;效应漂移下匹配Raw FSP较潜效应监督把平均检查点RMSE降低54.2%、教师缺陷降低99.0%,较已发布CausalPFN-S检查点RMSE降低10.2%。 这些数字把理论上的端点转变对应到具体比较对象(S-learner、潜效应监督、CausalPFN-S检查点)与具体场景(弱重叠、效应漂移、部署速度)。 摘要报告的具体百分比与单元计数;两项随机研究评估显示更低RMSE可以与残余衰减并存。

启示与展望

该工作面向因果表格基础模型的预训练阶段:合成表由平均处理效应加有效影响函数波动标注,部署保持为一次冻结前向传播,因此其结论适用于以固定部署总体为目标的效应估计流程。理论部分沿路径 T_{λ,P}=θ(P)+λP_nψ_P 给出端点转变与有限预训练界,实验部分覆盖24个非线性连续协变量单元、12个弱重叠单元、效应漂移场景、单线程热启动部署基准、已知效应半合成覆盖率检验与两项随机研究评估。对读者而言,这提供了一套可复用的标签构造与评估视角:把预训练监督与下游偏差、均方误差、方差、高斯近似和覆盖率联系起来,并给出可比较的基线(S-learner、潜效应监督、CausalPFN-S检查点)。

摘要提到两项随机研究评估显示更低RMSE可以与残余衰减并存,这提示读者在把RMSE改进直接读作效应估计改善时需要留意衰减问题。摘要未给出各实验的具体数据来源、样本规模与置信区间,也未说明方差头准确性的判定方式,因此覆盖率结论的适用范围仍需结合正文细节判断。此外,摘要未说明FSP在非表格数据、非连续协变量或非合成机制上的表现,这些属于尚待观察的范围。

来源