arXiv 2026年10月7日该工作提出 VALSE——一种逐样本、非连续的 Transformer 层跳过方法,用轻量难度估计器从前几层为每个输入打分并驱动逐层门控,同时给出期望 FLOPs 闭式公式、跳层模型函数空间严格包含于全层模型、以及与 MoE 的结构对偶三项理论结果;原型规模(12 层、SST-2)评估中所有样本被路由到最少层数,难度与激活层数的 Pearson 相关系数为负,核心的难度自适应路由假设未获验证。该工作提出 VALSE——一种逐样本、非连续的 Transformer 层跳过方法,用轻量难度估计器从前几层为每个输入打分并驱动逐层门控,同时给出期望 FLOPs 闭式公式、跳层模型函数空间严格包含于全层模型、以及与 MoE 的结构对偶三项理论结果;原型规模(12 层、SST-2)评估中所有样本被路由到最少层数,难度与激活层数的 Pearson 相关系数为负,核心的难度自适应路由假设未获验证。VALSE 提出逐样本非连续跳层框架并证明 MoE 对偶,但原型路由坍缩致核心假设未获验证该工作提出 VALSE——一种逐样本、非连续的 Transformer 层跳过方法,用轻量难度估计器从前几层为每个输入打分并驱动逐层门控,同时给出期望 FLOPs 闭式公式、跳层模型函数空间严格包含于全层模型、以及与 MoE 的结构对偶三项理论结果;原型规模(12 层、SST-2)评估中所有样本被路由到最少层数,难度与激活层数的 Pearson 相关系数为负,核心的难度自适应路由假设未获验证。该工作提出 VALSE——一种逐样本、非连续的 Transformer 层跳过方法,用轻量难度估计器从前几层为每个输入打分并驱动逐层门控,同时给出期望 FLOPs 闭式公式、跳层模型函数空间严格包含于全层模型、以及与 MoE 的结构对偶三项理论结果;原型规模(12 层、SST-2)评估中所有样本被路由到最少层数,难度与激活层数的 Pearson 相关系数为负,核心的难度自适应路由假设未获验证。