首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >扩散模型 >扩散模型通常采用哪些神经网络架构?

扩散模型通常采用哪些神经网络架构?

词条归属:扩散模型

1. U-Net 作为经典去噪骨干

早期及主流扩散模型普遍采用 U-Net 作为去噪网络。U-Net 是一种对称的卷积神经网络,包含下采样编码路径、瓶颈层和上采样解码路径,并通过跳跃连接保留细节信息。它最初用于图像分割,因其擅长多尺度特征提取,非常适合逐步去噪任务。

2. 注意力机制增强表达能力

现代 U-Net 在残差块之间引入自注意力与交叉注意力层。自注意力帮助模型捕捉全局上下文,交叉注意力则用于注入文本等条件信息,使网络的每个空间位置都能"查询"条件描述,决定该处应生成什么内容。

3. 扩散 Transformer 逐步兴起

近年来,Diffusion Transformer(DiT)用标准 Vision Transformer 取代 U-Net 作为去噪骨干,将潜空间分块序列化后交给 Transformer 处理,并通过自适应层归一化注入时间步与条件信息。Transformer 的缩放规律更清晰——模型越大、训练越充分,质量提升越稳定,这一特性推动了大规模扩散模型的发展。

相关文章
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券