训练的核心任务是让网络 ε_θ 学会识别"当前带噪样本中混入了多少噪声"。训练循环为:随机取一张真实样本、随机选一个时间步、随机加入对应程度的高斯噪声,然后让网络预测所加噪声,并与真实噪声计算均方误差,通过梯度下降不断更新网络参数。
噪声预测与得分匹配(Score Matching)在数学上紧密相关。得分函数定义为数据分布对数概率密度的梯度,而网络预测的噪声近似正比于带噪数据分布的得分。因此扩散模型也可理解为在多个噪声层级上学习数据分布的得分函数,这一视角将 DDPM 与基于得分的生成模型统一起来。
本质上,模型学习的是真实数据所在分布的统计结构,而非记忆具体样本。它掌握了"自然图像/音频在某个噪声水平下应呈现何种模式",从而能够在生成阶段把这一规律应用于全新噪声,产出训练集中从未出现过的样本。