像素级扩散模型直接在原始像素空间进行扩散,例如 512×512 的彩色图像对应超过 78 万个数值,每一步去噪都要处理如此高维的数据,计算与显存开销极大。潜在扩散模型(Latent Diffusion Model, LDM)则先在压缩的潜空间中进行扩散,最后再解码回像素。
LDM 使用预训练的变分自编码器(VAE)将图像压缩到低维潜空间。以 512×512 图像为例,VAE 编码器将其压缩为 64×64×4 的潜表示,维度降低约 48 倍,而感知上关键的信息基本得以保留。扩散过程在这个紧凑空间中完成后,再由 VAE 解码器重建为高清图像。
由于在潜空间操作,去噪网络的计算量与显存需求大幅下降,使得在消费级 GPU 上训练和运行高质量扩散模型成为可能。Stable Diffusion 正是 LDM 的开源实现,这一架构选择是生成式图像工具得以广泛普及的重要前提。