跳到主要内容
返回时间线
Advances in Computational Mathematics来源发表:

ReLU 卷积网络在 Korobov 空间把逼近阶从二阶提升到 m+1 阶,误差随维度的增长远弱于 Sobolev 情形

核心概要

该工作研究用 ReLU 深度卷积神经网络(CNN)逼近高阶 Korobov 函数 f∈K^{m+1}_p(Ω) 的 Lp 误差,证明当深度 L≤Csd^4m^3N(log_2 N) 时存在网络使 inf‖f−f_L‖_{Lp(Ω)}≤C_{m,d}‖D^{m+1}f‖_{Lp(Ω)}N^{−m−1}(log_2 N)^{(m+2)(d−1)},即把以往基于二阶混合导数的 O(L^{−2+1/p}) 阶逼近率提升到 (m+1) 阶(相差对数因子),并据此指出 CNN 的高阶表达能力并未严重受维度灾难影响。

Source-provided article image: Higher-order approximation rates for ReLU CNNs in Korobov spaces

深度剖析

对具有每方向 m+1 阶混合导数的 Korobov 函数,作者证明深度约 O(N log_2 N) 的 ReLU CNN 可达到 N^{−m−1}(含 (log_2 N)^{(m+2)(d−1)} 对数因子)的 Lp 逼近误差,m 越大阶数越高。 此前该方向的结果基本是 Lp(Ω) 中基于二阶混合导数的 O(L^{−2+1/p}) 阶逼近率;本文利用目标函数的高阶 Korobov 正则性,把阶数推广到任意高阶,并推广了 Mao 与 Zhou 关于深度 CNN 的低阶结果。 结论以定理形式给出(Theorem 1.3),证明在正文第 4 节完成,依赖稀疏网格高阶插值误差(Lemma 2.4)、系数上界(Lemma 2.3)以及 CNN 逼近多项式的结果(Theorem 3.5);文中说明 m=1、p=∞ 时深度与逼近率关于 N 的结果与 Mao 与 Zhou [2022] 相同,仅 d 的前因子由 d^2 log_2 d 变为 d^4。

作者给出高阶稀疏网格基函数的精确 ReLU 乘积因子分解:每个基函数 ϕ^α_{l,i}(x) 可写成 ∏_j∏_k ρ_{l_j,i_j,k}(x_j),其中每个 ρ 是形如 σ(a x + b) 的 ReLU 单元,且在 [0,1] 上取值介于 0 与 2^{n+d−1} 之间。 这把稀疏网格插值中每个一维基函数表示为分段线性(ReLU)因子的乘积,使高阶稀疏网格插值可直接由卷积层实现,是连接稀疏网格逼近与 CNN 结构的关键步骤。 该分解在定理 1.3 的证明中显式构造(m=2 时 ϕ^2=ρ_1ρ_2,m≥3 时 ϕ^{α_j}=∏_{k=1}^m ρ_k),并配有 d=1、l=4、i=3 的基函数与因子图示(图 4、图 5)。

作者证明 CNN 可逼近非负有界输入变量上的多项式:对形如 ∑_i c_i ∏_{j=1}^k y_{i,j} 的多项式,存在深度 J≤(256+28U)dlk^2/(s−1)+(3U+61)k 的 CNN,误差不超过 ‖c‖_∞·M^{2k−1}/2^{2U−k+2}。 文中指出,据其所知经典文献中尚无用 CNN 逼近多元多项式和基数 B 样条的结果;该定理把乘积 (x,y)↦xy 的近似(含非负性这一在经典文献中似缺失的性质)推广到多因子乘积,并指出多元多项式与基数 B 样条都具有该形式,因而可据此得到 Sobolev 与解析函数的 CNN 逼近率。 结论为 Theorem 3.5,证明通过对 k 的归纳完成,基础步骤用 Lemma 3.1 的乘积近似误差 |e^×_{M,U}(x,y)−xy|≤M^2/2^{2U} 与 0≤e^×_{M,U}(x,y)≤M^2,并逐次调用 Lemma 3.4 组合出所需深度。

作者将 CNN 逼近 Korobov 函数的维度影响与 Sobolev 情形对比,指出 Sobolev 函数 W^m_p(Ω) 的深度 L 网络逼近精度为 O(L^{−2m/d}),而本文对 Korobov 函数的结果表明维度影响没有那么大,从而缓解维度灾难。 这一对比把 Korobov 空间(混合光滑性)与 Sobolev 空间(各向同性光滑性)在 CNN 逼近率上的差别明确化,说明高阶表达能力在 Korobov 型函数上不会因维度而严重退化。 该判断基于定理 1.3 的误差界与文中引用的 Sobolev 逼近结果(Lu et al. [2021a];Siegel [2023])的对照;作者同时说明常数 C_{m,d} 对 m、d 有指数依赖。

启示与展望

该结果适用于定义在单位立方体 [0,1]^d 上、具有每方向 m+1 阶混合导数且边界为零的 Korobov 函数,逼近工具是使用 ReLU 激活与离散卷积的深度 CNN,误差在 Lp(1≤p≤∞)范数下度量。它给出的是存在性上界:存在深度不超过 Csd^4m^3N(log_2 N) 的网络达到该精度,而非给出训练算法或参数取值。作者指出,沿 Yang 与 Zhou 关于 CNN 的路线并结合本文的逼近误差界,可以建立对 p,m≥2 的 Korobov 函数用 CNN 模型 H^{s,d}_L 学习的收敛率;文中还提出一个猜想:对阶数 α<(d+2k+1)/2 的 Korobov 函数,用 n 个神经元的 ReLU^k 浅层网络或可达到 O(n^{−α}) 的近最优误差,留待后续研究。

作者明确表示目前不确定所给出的逼近误差界是否接近最优,并提到 Yang 与 Lu [2024] 借助稀疏网格与 bit-extraction 技术对 K^2_∞(Ω) 中的 Korobov 函数给出了 O(N^{−4}L^{−4})(相差对数因子)的超逼近率,因此用 bit-extraction 改进本文深度 CNN 的逼近率是有待探索的方向。误差界中的常数 C_{m,d} 对 m、d 有指数依赖,且结果含 (log_2 N)^{(m+2)(d−1)} 对数因子,这些在具体维度与光滑度下的实际影响仍需进一步分析。本文为理论工作,未报告数值实验,因此这些界在实际网络规模下的紧致程度尚不清楚。

来源