首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >扩散模型 >潜在扩散模型与像素级扩散模型有什么区别?

潜在扩散模型与像素级扩散模型有什么区别?

词条归属:扩散模型

1. 操作空间不同

像素级扩散模型直接在原始像素空间进行扩散,例如 512×512 的彩色图像对应超过 78 万个数值,每一步去噪都要处理如此高维的数据,计算与显存开销极大。潜在扩散模型(Latent Diffusion Model, LDM)则先在压缩的潜空间中进行扩散,最后再解码回像素。

2. 用 VAE 实现高倍压缩

LDM 使用预训练的变分自编码器(VAE)将图像压缩到低维潜空间。以 512×512 图像为例,VAE 编码器将其压缩为 64×64×4 的潜表示,维度降低约 48 倍,而感知上关键的信息基本得以保留。扩散过程在这个紧凑空间中完成后,再由 VAE 解码器重建为高清图像。

3. 效率提升带来普及

由于在潜空间操作,去噪网络的计算量与显存需求大幅下降,使得在消费级 GPU 上训练和运行高质量扩散模型成为可能。Stable Diffusion 正是 LDM 的开源实现,这一架构选择是生成式图像工具得以广泛普及的重要前提。

相关文章
从DDPM到LDM扩散模型的演进与优化解析【扩散模型实战】
扩散模型近年来在生成模型领域取得了令人瞩目的成果。特别是从早期的Denoising Diffusion Probabilistic Models (DDPM)到更高效的Latent Diffusion Models (LDM),扩散模型不仅在图像生成、文本生成等领域展现了强大的能力,而且在推理速度和计算效率上有了显著的改进。本文将对扩散模型的演变进行深入探讨,并结合代码实例帮助理解其核心原理。
百行代码
2024-09-09
4.1K0
Brief Bioinform|GLDM:基于约束图潜在扩散模型的分子生成
2024年4月4日,新加坡南洋理工大学Conghao Wang等人在Briefings in Bioinformatics上发表文章GLDM: hit molecule generation with constrained graph latent diffusion model。
智药邦
2024-05-28
1K0
详解Diffusion扩散模型:理论、架构与实现
Diffusion扩散模型是一类基于概率扩散过程的生成模型,近年来在生成图像、文本和其他数据类型方面展现出了巨大的潜力和优越性。该模型利用了扩散过程的逆过程,即从一个简单的分布逐步还原到复杂的数据分布,通过逐步去噪的方法生成高质量的数据样本。
TechLead
2024-07-26
5.9K0
CVPR2023 | PVDM:在投影潜在空间中的视频概率扩散模型
深度生成模型的最新进展表明,它们有望在各个领域合成高质量、逼真的样本,例如图像、音频、3D 场景 、自然语言等。作为下一步,一些作品已经积极关注更具挑战性的视频合成任务。与其他领域的成功相比,由于视频的高维性和复杂性,在高分辨率帧中包含复杂的时空动态,因此生成质量与真实世界的视频相去甚远。
用户1324186
2023-12-28
1.2K0
Stable Video Diffusion: 将潜在视频扩散模型扩展到大型数据集
在图像生成模型技术的推动下,视频生成模型在研究和应用领域取得了显著进展。这些模型通常通过从头开始训练或对预训练图像模型插入额外的时间层进行微调来实现。训练通常在混合的图像和视频数据集上进行。尽管视频建模的改进研究主要关注空间和时间层的排列方式,但先前的工作没有探究数据选择的影响。然而,训练数据分布对生成模型的影响是不可忽视的。此外,对于生成式图像建模,已经知道在大型和多样化的数据集上进行预训练,然后在小型但质量更高的数据集上进行微调,可以显著提高性能。然而,之前的视频建模方法往往借鉴了来自图像领域的技术,而对于数据和训练策略的影响,即在低分辨率视频上进行预训练再在高质量数据集上微调,还需要进一步研究。
用户1324186
2023-12-11
2.2K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券