跳到主要内容
返回时间线
arXiv来源发表:

VALSE 提出逐样本非连续跳层框架并证明 MoE 对偶,但原型路由坍缩致核心假设未获验证

相关研究与后续进展

核心概要

该工作提出 VALSE——一种逐样本、非连续的 Transformer 层跳过方法,用轻量难度估计器从前几层为每个输入打分并驱动逐层门控,同时给出期望 FLOPs 闭式公式、跳层模型函数空间严格包含于全层模型、以及与 MoE 的结构对偶三项理论结果;原型规模(12 层、SST-2)评估中所有样本被路由到最少层数,难度与激活层数的 Pearson 相关系数为负,核心的难度自适应路由假设未获验证。

AI-generated editorial illustration: VALSE: Vertical Adaptive Layer Skipping for Efficient Inference in Large Language Models

深度剖析

给出任意逐样本跳层调度的期望 FLOPs 闭式表达,并证明跳层模型函数空间严格包含于全层模型函数空间,附显式分离例子。 此前自适应深度工作缺少对任意(含非连续)跳层调度的计算量刻画,也未刻画跳层与全层模型之间的函数空间关系。 定理 2 与定理 10、11 为完整证明,且定理 10、11 仅在恒等残差(Scheme A)下成立;原型未对这些理论结果做直接实验验证。

提出 VALSE 方法:从最初若干层提取五维可解释特征(隐状态范数、层间增量范数、自注意力熵、预测熵、奇异值集中度)得到逐样本难度分数,经硬/软/全局三种路由变体产生非连续保留层集合,并配以四项辅助损失与三阶段课程学习。 既有方法或为截断式早退(只能保留前缀),或为逐 token 路由(无样本级难度语义),或为静态剪枝;VALSE 首次把条件计算从宽度维度扩展到深度维度并保留任意中间层。 方法设计与训练方案在文中完整给出,但原型实现省略了课程学习第一阶段并使用固定 Gumbel 温度,未完全执行设计。

建立 MoE 与 VALSE 的结构对偶:两者共享“路由器—选择算子—稀疏执行—负载均衡”模板,分别作用于宽度与深度两个正交维度,可组合为二维稀疏激活。 此前没有工作把水平 MoE 与垂直跳层统一为同一稀疏选择框架,二维稀疏激活区间未被占据。 命题 6 给出同构映射证明,定理 9 给出统一掩码表示;文中明确这是结构性而非功能性对偶,且混合架构的 FLOPs 优势(命题 8)仅有理论、未验证。

原型评估报告了一个透明的负结果:12 层模型在 SST-2 上平均激活层数从 12 降到 3(理论 FLOPs 节省 62.1%),准确率 0.62 对全深度 0.63,但这是路由坍缩到最小深度的退化结果,难度与激活层数的 Pearson 相关系数为负,与假设方向相反。 该结果把路由坍缩从理论风险(命题 17)变为可观测现象,并给出基于命题 21 的坍缩平衡点诊断与三条补救方向。 单机 CPU、单数据集、单随机种子、300 条训练样本、无外部基线;作者明确将其定位为原型级负结果而非性能基准。

启示与展望

该工作面向研究自适应深度条件计算与稀疏 Transformer 的读者,尤其是关心把稀疏性从宽度扩展到深度的研究者。理论部分(期望 FLOPs 公式、函数空间包含关系、MoE 对偶)在所述假设下自成体系,可直接作为后续工作的分析工具;方法部分的设计契约(五维特征、三种路由变体、四项辅助损失、三阶段课程)给出了可复现的实现蓝图。作者明确指出,结论的适用范围是原型规模:12 层、约百万参数、从零训练、SST-2 单数据集,且难度自适应路由这一核心假设在该规模下未获验证。要检验方法是否成立,需要在更大规模、带预训练权重、多数据集、多随机种子的设定下重做实验,并补齐外部基线与消融。

读者仍会关注几个开放问题。其一,难度—深度单调性(命题 4)是总体层面的理论陈述,依赖“层边际贡献随难度非减”的假设,其在大规模预训练模型上的经验有效性未被原型确立。其二,命题 21 刻画了路由坍缩的退化平衡点,但未给出可证明避免坍缩的超参数区间;作者提出的三条补救(降低平衡损失权重、下调门控偏置并退火、恢复三阶段课程)是基于该命题的可证伪假设,尚未执行。其三,难度分数的批内 min–max 归一化使其成为批内秩统计量,跨批次不可比,文中给出的 EMA 校准变体属于生产目标配置而非已运行结果。其四,非连续跳层在自回归生成上的可扩展性(位置无关门控、因果掩码兼容、自推测解码兜底)是架构层面的设计属性,未经实验检验。其五,理论 FLOPs 节省未转化为实际时延下降,工程实现仍是待办项。此外,本文为完整文本,但部分表格与超参数数值在正文中以占位形式呈现,具体数值需以随稿发布的训练日志与代码为准。

来源