首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >扩散模型

扩散模型

修改于 2026-09-10 11:21:04
21
概述

扩散模型(Diffusion Model)是一类通过模拟热力学扩散过程来生成数据的深度生成模型。其核心思想是:先在训练阶段逐步向真实数据添加高斯噪声直至其退化为纯噪声(前向过程),再学习反向逐步去噪、从噪声中恢复出清晰数据(反向过程)。生成时从一团随机噪声出发,在文本等条件的引导下逐步去噪,最终得到全新的样本。扩散模型凭借训练稳定、生成质量高、多样性好等优势,已成为图像、视频、音频生成等领域的主流范式,并在分子设计、药物发现等科学计算场景展现出重要价值。

一、扩散模型的基本工作原理是什么?

1. 前向加噪与反向去噪的对称过程

扩散模型包含两个互为逆过程的阶段。前向过程(Forward Process)是一个固定的马尔可夫链,逐步向真实数据 x₀ 添加高斯噪声,经过 T 个时间步后使其近似为标准高斯噪声 x_T。反向过程(Reverse Process)则由神经网络参数化,学习从噪声 x_T 出发,一步步去除噪声、恢复出清晰数据 x₀。生成新样本时,模型从随机噪声出发运行反向过程即可。

2. 训练目标简化为噪声预测

尽管反向过程在数学上需要建模每一步的均值与方差,但 DDPM 提出了一种更简洁的训练方式:让神经网络直接预测前向过程中实际加入的噪声 ε,训练损失即为预测噪声与真实噪声之间的均方误差。这一简化目标丢弃了理论推导中的加权项,却在实践中反而带来更好的生成质量,成为扩散模型走向实用的关键。

3. 从噪声到数据的逐步"显影"

生成阶段,模型拿到一团纯随机噪声和一段文本描述,在每一步预测并移除少量噪声。随着去噪迭代推进,整体构图、色彩分布先浮现,高频细节随后逐步清晰,最终"显影"出一张与文本描述相符的全新图像。由于起点是随机噪声,不同的噪声种子会生成差异明显的结果,固定种子则可获得可复现的输出。

二、扩散模型的前向扩散过程是如何进行的?

1. 逐步添加高斯噪声

给定一张真实图像 x₀,前向过程在 T 个时间步中按预定比例逐步注入高斯噪声。每一步的转移可表示为一个高斯分布,其中 β_t 称为噪声调度值,控制该步加入的噪声强度。随着时间步推进,β_t 通常从很小的值(如 0.0001)按线性或余弦方式增长到较大的值(如 0.02)。

2. 任意时间步的闭式采样

前向过程的一个关键技巧是无需逐步累加噪声,可以直接从 x₀ 一步跳到任意时间步 t 的噪声版本。此时 x_t 可表示为原始信号与噪声的加权组合,权重由累积噪声调度值 ᾱ_t 决定。这一闭式表达让训练时可以随机采样任意时间步,避免了逐帧计算,大幅提升训练效率。

3. 最终趋于标准高斯噪声

当时间步 T 足够大(通常设为 1000),累积的信号权重趋近于零,x_T 几乎完全由噪声构成,近似为标准高斯分布。这一设计保证了反向生成过程有一个明确、稳定的起点,也是后续所有采样算法的基础。

三、扩散模型的反向去噪过程是如何实现的?

1. 神经网络参数化去噪步骤

反向过程试图撤销前向加噪,从纯噪声 x_T 逐步恢复清晰图像 x₀。每一步的去噪转移被建模为一个高斯分布,其均值由神经网络根据当前带噪样本 x_t 和时间步 t 预测得到。实践中方差常设为与时间相关的固定对角矩阵,仅学习均值部分,以降低训练不稳定性。

2. 用噪声预测间接估计均值

模型并不直接预测反向步骤的均值,而是预测加入的噪声 ε_θ(x_t, t)。借助前向过程的代数关系,预测出的噪声可换算为反向步骤的均值估计。这种重参数化方式将复杂的似然优化问题转化为直观的噪声回归任务,是 DDPM 训练目标简洁有效的核心原因。

3. 迭代去噪直至清晰

生成时从 x_T 出发,对 t = T, T-1, …, 1 反复调用去噪网络,每一步减去预测的噪声分量,使样本逐渐向清晰数据分布靠拢。经过数十到数百步迭代后,随机噪声被逐步"雕刻"成结构完整、细节清晰的输出。

四、扩散模型训练时究竟在学习什么?

1. 学习预测每一步的噪声

训练的核心任务是让网络 ε_θ 学会识别"当前带噪样本中混入了多少噪声"。训练循环为:随机取一张真实样本、随机选一个时间步、随机加入对应程度的高斯噪声,然后让网络预测所加噪声,并与真实噪声计算均方误差,通过梯度下降不断更新网络参数。

2. 与得分匹配的内在联系

噪声预测与得分匹配(Score Matching)在数学上紧密相关。得分函数定义为数据分布对数概率密度的梯度,而网络预测的噪声近似正比于带噪数据分布的得分。因此扩散模型也可理解为在多个噪声层级上学习数据分布的得分函数,这一视角将 DDPM 与基于得分的生成模型统一起来。

3. 学习数据分布的统计规律

本质上,模型学习的是真实数据所在分布的统计结构,而非记忆具体样本。它掌握了"自然图像/音频在某个噪声水平下应呈现何种模式",从而能够在生成阶段把这一规律应用于全新噪声,产出训练集中从未出现过的样本。

五、扩散模型通常采用哪些神经网络架构?

1. U-Net 作为经典去噪骨干

早期及主流扩散模型普遍采用 U-Net 作为去噪网络。U-Net 是一种对称的卷积神经网络,包含下采样编码路径、瓶颈层和上采样解码路径,并通过跳跃连接保留细节信息。它最初用于图像分割,因其擅长多尺度特征提取,非常适合逐步去噪任务。

2. 注意力机制增强表达能力

现代 U-Net 在残差块之间引入自注意力与交叉注意力层。自注意力帮助模型捕捉全局上下文,交叉注意力则用于注入文本等条件信息,使网络的每个空间位置都能"查询"条件描述,决定该处应生成什么内容。

3. 扩散 Transformer 逐步兴起

近年来,Diffusion Transformer(DiT)用标准 Vision Transformer 取代 U-Net 作为去噪骨干,将潜空间分块序列化后交给 Transformer 处理,并通过自适应层归一化注入时间步与条件信息。Transformer 的缩放规律更清晰——模型越大、训练越充分,质量提升越稳定,这一特性推动了大规模扩散模型的发展。

六、文本条件是如何引导扩散模型生成的?

1. 文本编码器将提示转为向量

文本到图像模型首先用文本编码器把提示词转换为高维向量序列。常用编码器为 CLIP 的文本塔,它通过对比学习在海量图文对上训练,能将语义相近的文字与图像映射到接近的空间;部分模型也采用 T5 等纯语言模型作为编码器。

2. 交叉注意力注入去噪过程

文本向量通过 U-Net 或 Transformer 中的交叉注意力层注入去噪过程。在每一步去噪时,图像特征作为查询,文本向量作为键和值,使生成过程受到语义约束,从而让"金毛犬穿宇航服"这类描述真正引导噪声向对应图像收敛。

3. 无分类器引导强化对齐

Classifier-Free Guidance(CFG)是当前条件生成的标准手段。训练时随机丢弃文本条件,使模型同时学会条件生成与无条件生成;推理时将两者预测按引导尺度 w 加权组合,放大文本条件的影响。w = 1 表示无引导,常用范围为 7~12,w 越大图像越贴合描述但多样性有所下降。

七、扩散模型中的噪声调度器有什么作用?

1. 定义每一步的加噪强度

噪声调度器(Noise Schedule)是一组随时间步变化的噪声比例 β_t,它决定了前向过程中每一步加入多少噪声,以及反向过程中每一步去除多少噪声。调度曲线直接影响生成质量与训练稳定性。

2. 常见调度形式

早期 DDPM 采用线性调度,后续改进工作提出余弦调度,使信号在中间时间步的衰减更平滑,从而提升生成质量。此外还有与方差保持型随机微分方程对应的调度形式,不同调度适用于不同的模型与任务。

3. 影响采样效率与质量平衡

调度器还决定了反向采样时的步长策略。合理的调度能让去噪轨迹更接近一条平滑流形,使得使用更大步长跳跃前进成为可能,这为 DDIM、DPM-Solver 等少步数采样算法提供了理论基础。

八、潜在扩散模型与像素级扩散模型有什么区别?

1. 操作空间不同

像素级扩散模型直接在原始像素空间进行扩散,例如 512×512 的彩色图像对应超过 78 万个数值,每一步去噪都要处理如此高维的数据,计算与显存开销极大。潜在扩散模型(Latent Diffusion Model, LDM)则先在压缩的潜空间中进行扩散,最后再解码回像素。

2. 用 VAE 实现高倍压缩

LDM 使用预训练的变分自编码器(VAE)将图像压缩到低维潜空间。以 512×512 图像为例,VAE 编码器将其压缩为 64×64×4 的潜表示,维度降低约 48 倍,而感知上关键的信息基本得以保留。扩散过程在这个紧凑空间中完成后,再由 VAE 解码器重建为高清图像。

3. 效率提升带来普及

由于在潜空间操作,去噪网络的计算量与显存需求大幅下降,使得在消费级 GPU 上训练和运行高质量扩散模型成为可能。Stable Diffusion 正是 LDM 的开源实现,这一架构选择是生成式图像工具得以广泛普及的重要前提。

九、扩散模型有哪些常见的采样加速方法?

1. DDIM 确定性采样

DDIM(Denoising Diffusion Implicit Models)通过引入非马尔可夫、确定性的采样过程,允许跳过大量中间时间步,将原本上千步的采样压缩到数十步而质量损失有限。当随机性参数 η 设为 0 时过程完全确定,适合需要可复现结果的场景,也支持图像到图像的编码/解码。

2. 高阶求解器 DPM-Solver 与 UniPC

DPM-Solver 将扩散过程建模为连续时间下的常微分方程,利用高阶数值积分(如二阶、三阶方法)在 10~25 步内即可达到接近完整采样的质量。UniPC 进一步采用"预测-校正"框架,在 10~18 步的极少步数下仍能稳健收敛,适合对速度要求极高的场景。

3. 一致性蒸馏与实时生成

一致性模型(Consistency Models)与 LCM(Latent Consistency Models)通过蒸馏技术,将生成所需步数从 50 步压缩到 4~8 步,实现接近实时的生成。这类方法在交互式应用和批量出图场景中价值突出。

十、扩散模型的推理速度为什么较慢,如何优化?

1. 多步迭代的固有开销

扩散模型生成一张图像需要数十到数百次串行去噪,每次都要完整调用一次去噪网络,这与 GAN 单次前向即可出图形成鲜明对比。串行依赖决定了其推理延迟较高,在低延迟实时场景中面临压力。

2. 算法层面的优化

在算法层面,DDIM、DPM-Solver、UniPC 等少步数采样器可将迭代次数从数百降到 10~50 步;一致性蒸馏可进一步压到个位数步数;CFG 与步数需联合调节,过高引导尺度反而可能引入伪影,需按经验选取平衡点。

3. 架构与工程层面的优化

在架构层面,潜在扩散在压缩空间操作本身即降低了单步计算量;采用轻量化 VAE、混合精度推理、注意力机制简化等手段可进一步提速。在工程层面,可基于预训练模型微调而非从零训练,并借助一站式训推平台弹性扩展算力——例如可依托腾讯云大模型训推平台 TI-ONE 承载 Stable Diffusion 等模型的训练与推理,平台内置训练加速与推理优化引擎、支持 GPU 弹性算力调度,帮助降低大规模训练与高并发推理的成本与门槛。

十一、扩散模型如何实现图像修复与局部重绘?

1. 局部重绘(Inpainting)

局部重绘用于填补或替换图像中选定的区域。做法是仅对遮罩区域加噪,再在去噪过程中让模型依据周围未遮罩区域的上下文生成连贯内容,从而实现物体移除、背景修复、破损补全等效果。由于模型本就擅长"从部分恢复整体",这一能力与其去噪本质高度契合。

2. 向外扩展(Outpainting)

向外扩展可在原始画布之外继续生成内容,将竖图自然延展为横图,同时保持与已有构图在风格、光照和结构上的连续性,常用于画面扩展与构图重构。

3. 编辑的可控性

借助 ControlNet 等可控生成插件,还可以引入深度图、边缘、姿态骨架、分割图等额外条件,锁定构图或姿态,使修复与编辑结果更精确、更符合预期。

十二、扩散模型在图像超分辨率任务中如何应用?

1. 从低清到高清的重建

图像超分辨率旨在将低分辨率、模糊或老旧图片放大并补回高频细节。扩散模型把低清图像作为条件,从噪声出发在去噪过程中恢复出清晰、高分辨率的输出,相比传统插值方法能生成更自然、更具细节的纹理。

2. 条件引导保持结构

在超分过程中,低分辨率输入提供整体结构与语义约束,模型负责补全放大后缺失的细节,从而在放大的同时尽量保持原始内容与布局不失真。这类方法在老照片修复、医学影像增强、监控画面增强等场景有实际应用。

3. 级联式超分提升分辨率

部分先进系统采用级联扩散结构,先在低分辨率下生成主体内容,再通过多级超分模型逐级放大到高分辨率,从而在有限算力下获得更高分辨率、更高质量的最终图像。

十三、扩散模型在音频生成中是如何工作的?

1. 声波同样可加噪与去噪

音频是随时间变化的一维信号,其波形或梅尔频谱图同样可以被逐步加噪和去噪。扩散模型在音频频谱或波形空间执行与图像类似的去噪过程,从而生成音乐、音效与语音。

2. 语音合成与声音克隆

在语音领域,扩散模型被用于合成自然度更高的语音、进行声音克隆与跨语种配音。以 DiT 结合条件流匹配的架构为例,模型从噪声出发,在音素序列、时长与参考音频等条件引导下生成目标说话人的音频潜表示,再经声码器解码为波形。

3. 音乐与音效创作

在音乐与音效方面,扩散模型可根据文本描述生成配乐、环境音与特效音,也能对录音做降噪与增强处理。AudioLDM、Stable Audio 等系统展示了扩散范式在音频生成中的可行性,使其成为多模态生成的重要一环。

十四、扩散语言模型与自回归大语言模型有何不同?

1. 生成方式本质不同

自回归大语言模型按从左到右的顺序逐个预测 token,每一步都依赖前序 token,生成时间随序列长度线性增长。扩散语言模型(Diffusion Language Model, dLLM)则借鉴图像扩散思路,从一段被掩码或加噪的序列出发,在多轮去噪中并行地细化和填充多个位置的 token。

2. 并行生成与双向上下文

由于扩散语言模型在去噪时能同时"看到"整段序列,它具备双向上下文,生成不受严格因果顺序约束,可在多个位置并行更新。这使其在代码填充、内联编辑、约束满足等需要双向信息的任务上具有结构性优势。

3. 速度与质量的权衡

扩散语言模型以较少的去噪轮次并行生成整块 token,推理速度可显著快于同规模的自回归模型。当前代表性工作包括开源的 DiffusionGemma、学术界的 LLaDA 系列,以及 Mercury 等商业系统和 Gemini Diffusion 等实验性研究预览。不过在长文本连贯性与复杂推理上,扩散语言模型仍略逊于成熟的自回归模型,二者更多是互补而非替代关系。

十五、主流文生图产品是如何基于扩散模型构建的?

1. 以潜在扩散为通用底座

当前主流文生图产品大多建立在潜在扩散架构之上。它们在潜空间中执行扩散,配合文本编码器与交叉注意力实现文本到图像的控制,从而在可控算力下获得高质量输出。开源的 Stable Diffusion 系列是这一路线的代表,被广泛用于设计、营销素材与概念图生产。

2. 闭源产品叠加专有增强

闭源产品在此之上叠加各自的专有技术。例如部分系统采用级联式扩散实现高分辨率输出,部分使用更强的文本编码器提升提示理解能力,还有产品通过整流流 Transformer 等新一代架构进一步提升真实感与提示遵循度。

3. 从图像延伸到多模态

同一套扩散范式还被扩展到视频与三维生成——在时间维度上扩展扩散过程以生成连贯短片,或用于三维模型与纹理生成。这意味着扩散模型正从单一的图像引擎,演进为支撑多模态内容生成的通用基础。

十六、扩散模型与自回归模型在生成方式上有何本质区别?

1. 生成顺序与并行性

自回归模型按固定顺序逐元素生成,后一个元素依赖前一个,无法并行;扩散模型从整体噪声出发,通过多轮去噪并行地细化全部元素,生成时间主要取决于去噪步数而非序列长度。

2. 可编辑性与双向信息

自回归模型一旦输出某个 token 便难以回头修正,编辑通常需要重新生成后续内容;扩散模型天然支持双向信息与局部编辑,可只对目标区域重新去噪而不影响其余部分,在图像修复、代码填充等场景更自然。

3. 适用模态各有侧重

自回归模型在文本、代码等离散序列任务上占据主导,扩散模型则在图像、视频、音频等连续信号生成上表现突出。近年来二者也在相互借鉴——扩散语言模型把扩散引入文本,而 Transformer 也被用作扩散模型的骨干,呈现出融合趋势。

十七、扩散模型为什么训练比 GAN 更稳定?

1. 训练目标单纯明确

GAN 需要生成器与判别器相互对抗、动态博弈,二者平衡极为敏感,容易训练崩溃或模式崩溃。扩散模型的训练目标则是单一的噪声预测均方误差,是一个稳定的回归任务,不存在对抗博弈带来的振荡,因此更容易收敛、更易调参。

2. 输出多样性更丰富

由于训练目标不鼓励"只走少数捷径",扩散模型在同一提示下能生成差异显著、覆盖更广的结果,不易像 GAN 那样收敛到少数几种固定"套路"。这在需要创意多样性的内容生成场景中是重要优势。

3. 质量随规模可预测提升

扩散模型的生成质量随模型规模、训练数据和采样步数的增加而稳定提升,规律清晰;GAN 则常因训练不稳定而难以可靠地通过扩大规模获得更好效果。这一特性也是扩散模型在大规模生成任务中后来居上的原因之一。

十八、扩散模型存在哪些主要局限性?

1. 推理速度较慢

相比 GAN 的单次前向出图,扩散模型需要多步串行去噪,推理延迟较高,在对实时性要求极高的场景(如高频交易可视化、极速游戏渲染)中仍受限制。尽管少步数采样与蒸馏技术已大幅缓解这一问题,但仍是其主要短板。

2. 精细结构控制困难

模型学习的是整体视觉模式而非精确的几何与解剖规则,因此生成精细、结构化的细节时容易出错——典型如多画手指、文字错乱、复杂布局难以严格遵循。虽然 ControlNet 等可控工具能部分缓解,但精确控制仍是难点。

3. 算力与数据成本高

从零训练一个高质量扩散模型需要大规模 GPU 集群连续运行数天到数周,高分辨率推理也较耗显存。此外,训练数据多来自互联网,涉及版权归属争议,生成内容也可能被滥用于伪造信息或深度伪造,带来伦理与合规挑战。

相关文章
  • 扩散模型介绍
    1.4K
  • 扩散模型最新综述!
    2.9K
  • 详解 Diffusion (扩散) 模型
    2.1K
  • Diffusion扩散模型介绍
    885
  • 扩散模型 Diffusion Model
    2.1K
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券