扩散模型包含两个互为逆过程的阶段。前向过程(Forward Process)是一个固定的马尔可夫链,逐步向真实数据 x₀ 添加高斯噪声,经过 T 个时间步后使其近似为标准高斯噪声 x_T。反向过程(Reverse Process)则由神经网络参数化,学习从噪声 x_T 出发,一步步去除噪声、恢复出清晰数据 x₀。生成新样本时,模型从随机噪声出发运行反向过程即可。
尽管反向过程在数学上需要建模每一步的均值与方差,但 DDPM 提出了一种更简洁的训练方式:让神经网络直接预测前向过程中实际加入的噪声 ε,训练损失即为预测噪声与真实噪声之间的均方误差。这一简化目标丢弃了理论推导中的加权项,却在实践中反而带来更好的生成质量,成为扩散模型走向实用的关键。
生成阶段,模型拿到一团纯随机噪声和一段文本描述,在每一步预测并移除少量噪声。随着去噪迭代推进,整体构图、色彩分布先浮现,高频细节随后逐步清晰,最终"显影"出一张与文本描述相符的全新图像。由于起点是随机噪声,不同的噪声种子会生成差异明显的结果,固定种子则可获得可复现的输出。