首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >扩散模型 >文本条件是如何引导扩散模型生成的?

文本条件是如何引导扩散模型生成的?

词条归属:扩散模型

1. 文本编码器将提示转为向量

文本到图像模型首先用文本编码器把提示词转换为高维向量序列。常用编码器为 CLIP 的文本塔,它通过对比学习在海量图文对上训练,能将语义相近的文字与图像映射到接近的空间;部分模型也采用 T5 等纯语言模型作为编码器。

2. 交叉注意力注入去噪过程

文本向量通过 U-Net 或 Transformer 中的交叉注意力层注入去噪过程。在每一步去噪时,图像特征作为查询,文本向量作为键和值,使生成过程受到语义约束,从而让"金毛犬穿宇航服"这类描述真正引导噪声向对应图像收敛。

3. 无分类器引导强化对齐

Classifier-Free Guidance(CFG)是当前条件生成的标准手段。训练时随机丢弃文本条件,使模型同时学会条件生成与无条件生成;推理时将两者预测按引导尺度 w 加权组合,放大文本条件的影响。w = 1 表示无引导,常用范围为 7~12,w 越大图像越贴合描述但多样性有所下降。

相关文章
条件扩散模型-结合条件输入的图像生成技术详解
条件扩散模型(Conditional Diffusion Models, CDMs)近年来在图像生成领域获得了显著关注。与传统的扩散模型不同,条件扩散模型在生成过程中引入了额外的条件信息,从而能够生成更为符合特定需求的图像。这篇文章将深入探讨条件扩散模型的基本原理,并通过代码实例展示如何利用条件输入高效地生成图像。
百行代码
2024-09-13
7.6K0
向文本到图像扩散模型添加条件控制
Adding Conditional Control to Text-to-Image Diffusion Models
计算机视觉
2023-02-24
4.5K0
CVPR 2022 | DiffusionCLIP: 用于稳健图像处理的文本引导扩散模型
近期,结合对比语言-图像预训练(CLIP)的 GAN 反演方法在零样本图像操作方面引起了广泛关注,它可以根据文本提示进行图像操作。然而,由于 GAN 反演性能有限,它在各种类型的真实世界图像上的应用仍然很棘手。具体而言,成功的图像操作应该将图像属性转换为目标属性,同时不会对输入内容产生意外变化。然而,目前最先进的基于编码器的 GAN 反演方法往往不能成功重建具有新姿势、视角和细节的图像。当处理高变异数据集(如 LSUN-Church 和 ImageNet )中的图像时,这个问题变得更加严重。 最近,扩散模型,如去噪扩散概率模型(DDPM)和基于分数的生成模型在图像生成任务上取得了巨大的成功。最新的研究表明,与变分自编码器(VAEs)、流动模型、自回归模型和生成对抗网络(GANs)相比,这些模型在图像合成性能方面具有更高的质量。此外,最近的去噪扩散隐式模型(DDIM)进一步加速了采样过程,并实现了几乎完美的反演。 基于此,本文提出了一种新的 DiffusionCLIP 方法,这是一种通过扩散模型进行 CLIP 引导的强大图像操作方法。其关键思想是使用基于文本提示的 CLIP 损失来微调反向扩散过程中的评分函数,以控制生成图像的属性。这种方法可以成功地在训练过和未见过的领域中进行图像操作,甚至可以将图像从一个未见过的领域转换为另一个未见过的领域,或者从草图中生成未见过的领域的图像。此外,通过简单地将多个经过微调模型预测的噪声组合在一起,可以通过仅进行一次采样过程同时改变多个属性。另外,DiffusionCLIP 通过操作来自广泛多样的 ImageNet 数据集的图像,在 GAN 反演方面取得了一步进展。此前由于其较差的重建效果,该数据集很少被探索。本文还提出了一种系统的方法来寻找导致高质量和快速图像操作的最佳采样条件。
用户1324186
2023-09-09
2.4K0
扩散模型概述:应用、引导生成、统计率和优化
An overview of diffusion models: Applications, guided generation, statistical rates and optimization 扩散模型概述:应用、引导生成、统计速率和优化
CreateAMind
2024-07-05
2K0
使用扩散模型从文本生成图像
1代的DALLE使用VQ-VAE 的改进版,2代的DALLE2 通过使用扩散模型将图片的生成提升到了一个新的高度,但是由于其计算量很大而且没有开源,我们普通用户并没有办法使用,但是Stable Diffusion 的出现改变现状,可以让我们普通用户也可以直接使用,并且以前相对于 Disco Diffusion, Stable Diffusion 生成的图片更加实用;相对于 DALLE 2,Stable Diffusion 需要占用的资源更少,这样我们也可以在自己的电脑中使用它生成高质量的图片。
deephub
2022-11-11
2.1K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券