平均场贝叶斯神经网络的宽度鲁棒可学习性网络
Width-Robust Learnability in Mean-Field Bayesian Neural Networks
https://arxiv.org/pdf/2607.05735


摘要
无限宽极限是推演神经网络的一种标准方式,但这并不自动意味着极限学习器拥有与大型有限网络相同的计算复杂性理论归纳偏置。我们在平均场(或临界特征学习)缩放尺度下研究贝叶斯神经网络的这一问题。核心量是约化熵(reduced entropy):

即表示目标函数 yy 达到总体均方误差 εε 的集约先验成本。
我们的主要结果是一个宽度鲁棒可学习性定理。在固定深度下,一族布尔立方体(Boolean-cube)目标函数在无限宽度下可从多项式数量样本中学习,当且仅当它在多项式宽度下可学习,当且仅当其约化熵是多项式有界的。等价地,在精度允许多项式松弛的情况下,贝叶斯平均场学习器恰好能在那些可由多项式大小网络表示的目标函数上进行泛化。
正向结论是通过一种子采样形式证明的:从平均场解中的无限多个隐藏神经元中,可以选出多项式数量的代表,并且仍然同时在每个输入上保持学习到的函数。在临界缩放下,这种子采样既包含一个“主动”分量(保留数据依赖的低维统计量),也包含一个“惰性”分量(从先验中重采样熵主导的方向)。因此,无限宽平均场极限给出了学习的清晰解析描述,且没有引入虚假的宽度依赖泛化能力。
1 引言
宽神经网络的泛化能力远超其参数量所暗示的水平,因为它的先验在简单、结构化的函数上分配的概率质量多于复杂函数。将这一点精确化意味着确定模型的归纳偏置:即通过贝叶斯条件化,由网络架构与权重先验共同诱导出的目标函数上的复杂度排序。对于目标函数 yy,自然的复杂度参数是网络以给定精度拟合 yy 的先验对数概率——yy 越难表示,该概率越小,复杂度越大。我们在过参数化状态下研究这种复杂度及其所控制的可学习性,因为在该状态下诱导出的函数空间偏置最为清晰。

哪种无限宽度? 过参数化通常通过无限宽极限来进行理想化,但存在几种这样的极限,且它们对复杂度的看法并不一致。在 lazy(NTK/NNGP)缩放下,网络表现得像一种固定的核方法 [10, 12],具有高斯过程的归纳偏置;这类方法在简单的结构化目标(如奇偶校验函数)上已被证明需要超多项式数量的样本 [7, 1],即使这些目标是由小型网络计算的。平均场 或临界丰富缩放

[14, 4, 2, 23] 保留了有限网络中不同的部分。输出仍然是许多隐藏神经元的平均值,但在看到数据后,这些神经元的分布被允许发生变化。因此,无限宽对象不是一个冻结的核,而是一个描述典型学习到的隐藏神经元的概率分布律。人们普遍预期这种极限能恢复一种更类似电路的复杂度排序。目前所缺失的是针对它的泛化理论——并且同样重要的是,一个论证来说明无限宽极限对于实际使用的有限宽度究竟有何意义。

这可以看作是对平均场极限的一种复杂性理论的健全性检查(sanity check)。无限宽方程用一个更清晰的对象替代了大型有限网络:不再追踪每一个神经元,而是追踪典型学习神经元的概率律,或者等价地,追踪一个自洽核与倾斜(tilts)的系统。该定理表明,这个更清晰的对象并没有仅仅因为拥有无限多个可用神经元而获得人为的计算优势。无限宽改变了学习的解析描述,但没有改变那些能以多项式样本复杂度学习的目标类别。因此,平均场方程中可见的机制并非无限资源的伪影(artifacts):任何低的平均场解都有一个多项式宽度的实现,具有相同的预测结果(允许多项式松弛)。

与先前工作的关系。 该结果在精神上与最近展示过参数化神经网络可以拥有仅凭参数计数不可见的函数空间简单性偏置的工作最接近。Buzaglo, Harel, Nacson, Brutzkus, Srebro, 和 Soudry [3] 表明,从看似平坦的参数先验中抽取的典型随机插值网络之所以能从窄教师网络泛化,是因为参数化中的冗余在函数上诱导了非均匀先验。Daniely 和 Granot 的近似描述长度框架为范数控制的神经网络提供了另一条途径,以获得弱宽度依赖或宽度独立的样本复杂度界限 [5, 6]。我们的贡献是互补的:与其直接界定一个有限类,我们识别了无限宽平均场贝叶斯学习器的集约后验熵,并证明低熵无限宽解可压缩为多项式宽度。



2 设置
2.1 模型与先验



2.2 学习目标与贝叶斯均方误差条件化
学习目标是总体均方误差



3 主要结果
我们在推导证明它们的平均场形式体系(从 §4.1 开始)之前陈述结果。第一个是标题性的等价关系;第二个是引擎。


4 平均场极限及其推论
4.1 无限宽极限
当

时,网络容许标准的平均场描述,我们将其作为引用的输入,并回顾我们所使用的两个特征。特征学习机制中的存在性和结构在 [14, 22, 4, 17, 16, 23, 2] 中得到发展,而在与 (2) 相关的贝叶斯/后验形式中,则在 [21, 20, 11] 中得到发展。


4.2 有限约化熵的首要推论
构造所需的三个量在此处由既定假设和有限约化熵界定:与精度约束共轭的逆温、读出二阶矩以及层敏感度(即惰性坐标分数)。第一个量使“界上的多项式灵活性”精确化,并且是间隙 ΔΔ 介入的唯一位置。


这是命题 A.10 和命题 A.7 的正文形式。关键在于,正则性假设是从 Gibbs KL 率界推导出来的,而不是从硬球上的支撑推导出来的:引理 A.2 将 KL 率转移到单点边缘分布,高斯熵不等式给出了矩和算子范数截断,而后缀伴随不变量逐层界定了被截断总体对输出层的实际贡献。约化熵仅通过引理 4.3 或引理 A.1 的经验自由能界引入,它们提供了所需的多项式值 RR。
4.3 谱分裂


5 逐点压缩
5.1 惰性交换引理


5.2 构造与压缩定理





6 通过克隆的守恒
克隆是压缩的低成本逆操作。窄教师网络的函数是由一个单点律复现的,该律仅倾斜教师网络自身的(多项式维度的)主动方向,并将每个互补方向保留在先验状态,因此它所消耗的约化熵在教师宽度上是多项式级别的——数据占据了一个 poly(W) 维的子空间,而其余部分则是先验。



7 可学习性
7.1 低约化熵蕴含 Gibbs 可学习性







逐点压缩正是使得来自先验宽度-NN(或无限宽度)Gibbs 后验的采样能够与一个固定的有限维类进行比较以应用联合界(union bound)的原因。硬约化熵球提供了多项式预算;它本身并非学习器。
7.2 逆命题:Gibbs 可学习性蕴含低约化熵


机制仍然是死记硬背加上测度变换,但测度变换现在从经验 Gibbs 律开始,而非硬经验后验。
7.3 等价性的组装


8 讨论

逐点见证带来的收益。 约化熵是通过均方误差定义的,这是一种稳健的复杂度度量;然而证明它的压缩却是逐点的。这不是表面上的加强。正是逐点一致性使得来自(先验宽度-NN,甚至是无限)后验的采样能够被置于一个固定的有限维类中以应用联合界,并且使得无限宽和多项式宽的学习器作为函数而不仅仅是风险达成一致——这就是归纳偏置(而不仅仅是可实现的损失)跨宽度守恒的意义所在。
原文链接:https://arxiv.org/pdf/2607.05735