跳到主要内容
返回时间线
arXiv来源发表:

Transformer神经量子态在上下文学习下的泛化误差被证明随上下文样本数与网络深度反比下降,所需深度仅随系统规模线性增长

相关研究与后续进展

核心概要

该工作为基于Transformer的神经量子态在上下文学习(ICL)下的泛化行为建立理论框架:证明存在一种Transformer架构,其逐点预测误差(MSE)随上下文样本数与网络深度反比下降,且达到该保证所需的深度仅随系统规模(连续系统的粒子数或离散系统的qudit数)线性增长;作者进一步将分析扩展到以秩一密度算子表示的完整量子态,在连续与离散域上给出受物理约束的MSE泛化界,并用数值模拟验证了理论预测的标度行为。

Source-provided article image: Generalization of Transformer-Based Neural Quantum States via In-Context Learning
Figure 1 ·

Figure 1: In-Context Learning Framework for Transformer-Based Neural Quantum States.

arXiv

深度剖析

建立了Transformer神经量子态在推理时ICL下的严格泛化误差界,逐点预测误差随上下文样本数和Transformer深度反比下降。 此前Transformer神经量子态的泛化性能仅有经验演示,缺乏定量理论刻画;该工作首次给出显式的MSE标度律,并揭示深度与上下文信息量之间的权衡。 定理1在样本与查询i.i.d.、各分量属于有界一阶绝对矩函数类的假设下给出高概率界,完整推导见附录A;证明为构造性,通过特征表示、Lasso估计与不精确近端梯度法将非线性预测归约为有限维线性估计。

达到该泛化保证所需的Transformer深度仅随系统规模线性增长,即连续系统的粒子数或离散系统的qudit数。 相比对一般量子态可能出现的指数依赖,该结果表明在所述设定下架构容量需求是多项式(线性)的,为Transformer在高维量子系统中的可扩展性提供理论依据。 定理1给出充分深度条件,连续与离散情形分别按粒子数与qudit数标度;附录A.5给出更精细的逐层注意力头配置作为充分条件。

将分析从无约束预测扩展到物理可容许的归一化波函数/量子态及其诱导的密度算子,在连续与离散域上给出MSE泛化界。 相比定理1的未归一化设定,定理2引入归一化与算子级误差分析,把逐点误差控制转换为全状态空间上的Frobenius范数误差。 定理2在定理1相同设定下给出高概率界,证明见附录D;文中说明连续情形的体积因子与离散情形的基数因子源于配置空间大小,而非额外的统计或优化复杂度。

框架可推广到更广泛的量子性质预测任务,并在MPO表示的结构化量子态上给出多项式深度需求。 分析不限于波函数/量子态预测,可覆盖量子保真度、纠缠熵、两点关联函数、局部可观测量期望值与能量方差等确定性函数;对键维数为的MPO,所需深度按自由度多项式标度而非指数。 式(29)(30)给出MPO情形下的深度条件与泛化界;作者指出该多项式标度依赖结构化MPO表示,不覆盖一般指数自由度的量子态。数值实验(图4)显示NMSE随上下文样本数增加单调下降,且固定容量下系统越大NMSE越高,与理论一致。

启示与展望

该结果面向在推理阶段使用固定参数、通过上下文样本进行ICL的Transformer神经量子态,适用于连续有界能量域与离散多体量子配置空间,样本与查询按i.i.d.假设从与训练分布结构相同的分布中抽取。定理给出的是存在性保证:存在一种Transformer架构达到所述界,而非对所有参数选择的一致最优性。对以键维数为的MPO表示的结构化量子态,深度需求按自由度多项式标度,适用于低纠缠量子态这一广泛但非全部的情形。该框架可延伸至量子保真度、纠缠熵、两点关联函数、局部可观测量期望值与能量方差等由量子态确定的性质预测。

理论分析基于为证明而引入的增广嵌入矩阵,而数值实验使用实际嵌入矩阵;作者指出将理论严格扩展到实际嵌入设定仍是未来方向。当前假设偏向证明便利,识别更贴合量子学习问题内在结构的假设是开放问题。此外,定理仅确立达到保证的架构存在性,实际训练算法能否以可证保证收敛到此类解尚未解决。连续与离散体积因子的表观差异源于配置空间归一化方式不同,在更物理的每粒子体积标度下二者趋于一致,这一解读依赖所采用的归一化约定。

来源