GAN 需要生成器与判别器相互对抗、动态博弈,二者平衡极为敏感,容易训练崩溃或模式崩溃。扩散模型的训练目标则是单一的噪声预测均方误差,是一个稳定的回归任务,不存在对抗博弈带来的振荡,因此更容易收敛、更易调参。
由于训练目标不鼓励"只走少数捷径",扩散模型在同一提示下能生成差异显著、覆盖更广的结果,不易像 GAN 那样收敛到少数几种固定"套路"。这在需要创意多样性的内容生成场景中是重要优势。
扩散模型的生成质量随模型规模、训练数据和采样步数的增加而稳定提升,规律清晰;GAN 则常因训练不稳定而难以可靠地通过扩大规模获得更好效果。这一特性也是扩散模型在大规模生成任务中后来居上的原因之一。