早期及主流扩散模型普遍采用 U-Net 作为去噪网络。U-Net 是一种对称的卷积神经网络,包含下采样编码路径、瓶颈层和上采样解码路径,并通过跳跃连接保留细节信息。它最初用于图像分割,因其擅长多尺度特征提取,非常适合逐步去噪任务。
现代 U-Net 在残差块之间引入自注意力与交叉注意力层。自注意力帮助模型捕捉全局上下文,交叉注意力则用于注入文本等条件信息,使网络的每个空间位置都能"查询"条件描述,决定该处应生成什么内容。
近年来,Diffusion Transformer(DiT)用标准 Vision Transformer 取代 U-Net 作为去噪骨干,将潜空间分块序列化后交给 Transformer 处理,并通过自适应层归一化注入时间步与条件信息。Transformer 的缩放规律更清晰——模型越大、训练越充分,质量提升越稳定,这一特性推动了大规模扩散模型的发展。