ALICE 用一次预训练的 Transformer 在零样本下估计互信息,在 Beyond Normal 基准的 1k 样本预算上误差至少比对手低两倍,并在生物、遗传与神经科学数据上复现既有结论
核心概要
作者提出 ALICE,一个仅在合成分布族上训练一次的 Transformer 基础模型,它把互信息估计转化为对未见分布整流流速度场的上下文内估计,在 Beyond Normal 基准上与逐分布训练的神经估计器竞争,并在 1k 样本预算下误差至少低两倍,同时在模型从未见过的生物学、遗传学和神经科学数据上零样本复现并扩展了专用估计器的结论。
深度剖析
ALICE 把互信息估计改写为整流流速度差的时间积分,并用一个上下文条件化的 Transformer 一次性给出联合场与两个块条件场,从而免去逐分布训练。 此前的 MINE、InfoNCE、NWJ、SMILE 以及 MINDE、InfoBridge、FMMI 等扩散类估计器都需要为每个分布重新训练,InfoAtlas 虽用超网络摊销但存在精度损失;ALICE 保持单一网络,通过注意力以样本为条件,不产生分布专属参数。 论文给出速度形式恒等式的推导(定理 1、定理 2),并说明该恒等式对真实场是精确的、不涉及变分下界;训练目标为掩码流匹配 MSE,不需要互信息标签。
在 Beyond Normal 基准上,ALICE Base 在 1k、10k、100k 三个匹配预算下均取得最低平均绝对误差,1k 样本时误差至少比所有对手低两倍。 该基准的对手都在每个分布上单独训练并调参,而 ALICE 是零样本;论文报告 1k 样本时最佳经典估计器 CCA 为 0.42 nats,MINDE 从 1k 到 100k 才从 1.51 降到 0.40 nats,说明小样本区间是既有神经估计器的薄弱区。 评估使用 Czyż 等人 2023 年的 Beyond Normal 套件,联合宽度从 2 到 50,提供闭式真值;每个估计器获得相同样本预算,ALICE 把预算拆成查询样本与上下文样本,结果取八次独立上下文抽取的均值。
在三个模型从未见过的科学领域,ALICE 零样本复现了专用估计器的结论并给出更细的分解:单细胞 NF-κB 信号、拟南芥 TATA-box 启动子定位、以及小鼠视觉皮层六区的 O-information。 Jetka 等人 2019 年用逐分析拟合线性分类器的近似互信息方法,Bounoua 等人 2024 年把全部 session 合并训练一个基于分数的估计器;ALICE 用冻结检查点对每个 session 单独估计,从而分离出熟悉图像与新颖图像两天的差异,这是合并分析无法做到的。 三个应用都处于小样本区间:每个剂量 100 到 500 个细胞、整个启动子数据集约 1 万条序列、每个 session 约 100 到 200 次独立闪光;论文报告了与参考研究一致的容量峰值位置、TATA-box 峰值落在已记录的 −40 到 −20 碱基区间,以及新颖图像 session 中每个窗口、每只小鼠的 O-information 均为正。
ALICE 的架构对联合宽度和上下文长度都保持参数不变,并支持不同数据维度与样本基数,因此同一检查点可直接用于离散序列、时间序列和连续向量。 InfoAtlas 的超网络输出固定形状的权重,把估计器绑定在训练时的联合宽度上;ALICE 用坐标共享的标量 token 化、无位置编码的集合注意力、诱导潜变量瓶颈和从上下文估计的关系图,使参数计数与宽度和上下文长度无关。 论文给出架构细节与缓存机制,说明关系图、上下文 token 和诱导潜变量只依赖上下文、可跨查询复用;启动子应用把每个碱基编码为一个实坐标,块维度 4 与 600 由模型原生处理。
启示与展望
这项工作面向的是每分布训练不现实、样本量只有几百到几千对的数据场景,例如生物学和神经科学中的单细胞信号、调控序列和神经记录。它使研究者可以用一个冻结的检查点对每个 session、每个剂量或每个窗口单独估计互信息,而不必为每个系统训练一个网络;论文报告 ALICE 可作为本地模型在普通硬件上运行,每次估计只需少量前向传播。适用前提是数据能被表示为坐标块,且离散符号通过固定单射嵌入映射到实数坐标。
论文的局限一节说明实现仍是研究代码、尚未充分优化,并指出模型规模、训练预算、训练语料的维度和训练时的最大上下文长度都还有提升空间。基准上仍存在两类系统性偏差:螺旋嵌入被低估、稠密多元正态被高估,且随宽度增长;ALICE Small 在宽任务上随上下文增大反而退化。三个科学应用没有真值互信息,结论是与参考研究的生物学结论对照得到的,其中神经科学部分还显示熟悉图像 session 与新颖图像 session 在视觉响应到达之前就已相差约 0.1 nats,且动物身份解释了峰值窗口估计约 60% 的方差。此外,本次加载的文本在基准结果表格中多处数值缺失,因此无法核对具体误差数字,只能依据正文叙述。
