跳到主要内容
返回时间线
arXiv来源发表:

37k参数学习型优化器0.87 GPU小时训练后零样本迁移,在BERT-Tiny上降低验证损失9.1%

核心概要

本文提出一种轻量且通用的学习型优化器,通过动态重组按不相交时间跨度平均的梯度历史来工作:预测空间被压缩为每个梯度平均一个标量系数并由多个参数共享,对更早梯度做渐进平均以降低长历史的内存开销,同时保持各段贡献可独立访问;一个37k参数网络训练0.87 GPU小时后零样本泛化到未见任务,在BERT-Tiny与GPT-Tiny上分别降低验证损失9.1%与0.4%,在Vision Transformer上相对Adam提升测试准确率3.5个百分点,在九个图模型上平均提升2.7个百分点,FLOPs开销低至0.3%。

Source-provided article image: Lightweight and Versatile Learned Optimization by Recombination of Gradient History
Figure 2 ·

Figure 2: Dynamic recombination of multi-resolution gradient history. For each parameter group, the current gradient enters a multi-resolution history. A group feature encoder converts each stored average into a fixed-dimensional slot feature, and a joint temporal predictor assigns the coefficients used to recombine the history into the group update. Step index t t is omitted in the figure as it represents a single optimization step.

arXiv

深度剖析

提出一种学习型优化器,其核心机制是动态重组梯度历史,历史以不相交时间跨度的平均值表示。 相对以往学习型优化器,这里把预测空间压缩为每个梯度平均一个标量系数,并由多个参数共享,从而在保留历史信息的同时降低学习与预测的复杂度。 摘要层面给出机制描述与量化结果:37k参数网络、0.87 GPU小时训练,并在多类模型上报告零样本迁移表现。

对更早的梯度采用渐进平均,在压缩长历史内存占用的同时保持各段贡献可独立访问。 这一设计使长程梯度历史不必以完整形式存储,却仍能被优化器分别调用,兼顾内存效率与历史利用的灵活性。 摘要以机制陈述为主,未给出内存占用的具体数值,仅说明其最小化长历史的内存成本。

训练得到的优化器可零样本泛化到未见任务,并在多类架构上优于Adam。 在BERT-Tiny与GPT-Tiny上分别降低验证损失9.1%与0.4%;在Vision Transformer上测试准确率相对Adam提升3.5个百分点,在九个图模型上平均提升2.7个百分点。 结果覆盖语言与视觉、图模型等多类任务,并报告FLOPs开销低至0.3%,说明性能提升伴随较低计算代价。

启示与展望

该结果面向希望以低训练与计算成本获得通用优化器的研究者与工程实践者,适用于摘要所述的语言模型(BERT-Tiny、GPT-Tiny)、视觉Transformer与图模型训练场景;其价值在于零样本迁移到未见任务,并以低至0.3%的FLOPs开销换取相对Adam的验证损失与测试准确率改进。

摘要未说明梯度平均的具体时间跨度划分方式、标量系数的学习目标与训练任务分布,也未给出内存占用的具体数值与统计显著性;这些开放问题需在原文中确认。此外,当前仅依据摘要,无法判断结果在不同规模模型与更长训练下的表现。

来源