跳到主要内容
返回时间线
arXiv来源发表:

DepthBench 在 10 种架构上固定参数量扫描宽深比:HC 与 Full AttnRes 在极深窄形状下仍持续降低验证损失,Pre-LN 反而变差

核心概要

该工作提出 DepthBench 受控基准,在固定参数量与预训练配方下把宽深比(d_model/n_layer)从浅宽扫到深窄,比较 10 种代表性残差与归一化架构,发现深度带来的收益强烈依赖架构:Pre-LN 及其多数归一化/缩放变体在更深更窄时验证损失上升(Pre-LN 从 2.759 升至 2.782),而 HC 与 Full AttnRes 持续改善(HC 从 2.729 降至 2.699,Full AttnRes 从 2.751 降至 2.718),并伴随更强的层间因果依赖与顺序敏感性,但深模型也带来算力与显存开销。

AI-generated editorial illustration: DepthBench: Measuring How Residual Connections Enable More Computational Depth

深度剖析

DepthBench 把深度当作容量分配问题:在总参数量近似固定(主基准 400M 总规模、7 种形状、宽深比从 76.0 到 9.1)且预训练配方固定的条件下,系统改变宽深比,并对每个形状做学习率扫描后取最优值报告,从而把深度效应与模型规模、学习率次优等混杂因素分开。 此前 LNS、KEEL、AttnRes、HC、mHC 等方法各自在不同架构、训练配方与系统配置下评估,收益无法干净归因;该工作首次在同一 LLaMA 式骨干、同一数据(FineWeb-Edu,每参数 20 token)与同一优化设置下横向比较 10 种残差设计。 主基准 400M 总参数、7 种形状、10 种架构;另有骨干固定 300M 的等骨干对照、200M–500M 多尺度套件与 1.6B 验证套件;每个宽深比都做架构专属学习率扫描并取最优。

深度收益高度依赖残差连接设计:Pre-LN 与多数归一化/缩放变体(Sandwich-LN、LNS、DeepNorm、KEEL、MoDA)对更深更窄不敏感甚至变差,最优形状落在较宽或中间形状;HC 与 Full AttnRes 则随深度增加持续改善,直到 70 层、宽深比 9.1 的极端深窄形状。 这给出了一个受控的排序结论:并非所有“改进归一化或残差”的方法都能把架构深度转化为有效计算深度,残差拓扑本身才是关键变量。 验证损失数值:Pre-LN 由 2.759 单调升至 2.782;Full AttnRes 由 2.751 降至 2.718;HC 由 2.729 降至 2.699;在固定骨干规模时深窄模型改善、总规模反而下降,说明收益来自宽深分配而非骨干变大。

收益不止于预训练损失:更深的 HC 与 Full AttnRes 在编码、STEM、数学任务的 teacher-forced NLL 上总体更低,STEM 与数学上趋势尤其清晰,说明宽深分配的优势转化为领域相关的预测能力。 把“深度是否有效”的判据从单一验证损失扩展到领域任务 NLL,并显示趋势在 200M–500M 与 1.6B 尺度上延续(Full AttnRes 更稳定,HC 在更大尺度上稳定性较弱,500M 最大宽深比出现梯度爆炸)。 多尺度套件覆盖 200M、300M、400M、500M,1.6B 套件含三种形状;评估采用 NLL 协议而非仅报告训练损失。

层级别分析把收益与“层被真正用起来”联系起来:HC 与 AttnRes 的表示角度距离更大且随深度非平滑,后四分之三层中超过阈值的因果分数与置换分数比例明显更高(Full AttnRes 约 与 ,HC 约 与 ,Pre-LN 仅约 与 );同时 Block AttnRes 因深度混合在早期几乎不给运行和权重而存在“死区”,mHC 的残差映射乘积有效秩更低(– 对 HC 的 –),提示稳定化约束会削弱长程路径多样性。 不仅报告性能差异,还给出机制层面的对照:Full AttnRes 通过直接检索早期子层输出、HC 通过多流递归重组实现跨深度访问,而 Pre-LN 类架构的深层趋于平滑且可互换。 采用角距离、因果分数与置换分数三类受控层级别分析,并聚焦网络后四分之三层以避开前几层的普遍强效应;mHC 与 Block AttnRes 的机制解释配有路由权重与残差映射谱分析。

启示与展望

该结果面向在固定参数预算下选择模型形状的研究者与工程团队:当目标是让更多层贡献有效计算时,可优先考虑 HC 或 Full AttnRes 这类多流或跨层访问的残差设计,而 Pre-LN 及其归一化变体更适合较宽较浅的形状。适用场景是受控的预训练比较,主基准为 400M 总参数、20 token/参数、序列长度 2048,并在 200M–500M 与 1.6B 上做了趋势验证;作者同时发布代码与覆盖多种宽深比的检查点,便于继续探索精度与效率的权衡。

仍待观察的是:这些趋势在远超 1.6B 的规模、不同数据配方与分词器下是否保持;HC 对优化超参更敏感,500M 最大宽深比出现梯度爆炸、1.6B 上深度收益不再清晰,说明其稳定性边界尚需更细的学习率与初始化调优来刻画;深窄模型在预填充 FLOPs(约 3.0 升至 4.4 TFLOPs/序列)、KV 缓存(增加超过一倍)、峰值显存与 GPU 小时上的开销,意味着实际收益取决于内核与并行基础设施的配套程度;此外,本文为全文解析,但部分图表数值以区间或省略形式呈现,具体阈值与完整热力图需查阅附录。

来源