首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >扩散模型 >主流文生图产品是如何基于扩散模型构建的?

主流文生图产品是如何基于扩散模型构建的?

词条归属:扩散模型

1. 以潜在扩散为通用底座

当前主流文生图产品大多建立在潜在扩散架构之上。它们在潜空间中执行扩散,配合文本编码器与交叉注意力实现文本到图像的控制,从而在可控算力下获得高质量输出。开源的 Stable Diffusion 系列是这一路线的代表,被广泛用于设计、营销素材与概念图生产。

2. 闭源产品叠加专有增强

闭源产品在此之上叠加各自的专有技术。例如部分系统采用级联式扩散实现高分辨率输出,部分使用更强的文本编码器提升提示理解能力,还有产品通过整流流 Transformer 等新一代架构进一步提升真实感与提示遵循度。

3. 从图像延伸到多模态

同一套扩散范式还被扩展到视频与三维生成——在时间维度上扩展扩散过程以生成连贯短片,或用于三维模型与纹理生成。这意味着扩散模型正从单一的图像引擎,演进为支撑多模态内容生成的通用基础。

相关文章
草图指导的文生图扩散模型
文本到图像模型是机器学习发展中的一次飞跃,展示了根据给定文本提示的图像的高质量合成的能力。然而,这些强大的预训练模型缺乏可以指导合成图像的空间属性的控制方法。在这项工作中,作者引入了一种通用方法,通过在推理期间使用来自另一个域(例如草图)的空间图来指导预训练的文本到图像扩散模型。该方法不需要为任务训练专用模型或专门的编码器。
用户1324186
2023-09-19
1.2K0
CVPR 2024 | 可控文生图11篇汇总!基于扩散模型diffusion的text-to-image
3D资产生成正受到大量关注,受到最近文本引导的2D内容创建成功的启发,现有的文本到3D方法使用预训练文本到图像扩散模型来解决优化问题,或在合成数据上进行微调,这往往会导致没有背景的非真实感3D物体。
公众号机器学习与AI生成创作
2024-04-18
5K0
SIGGRAPH 2023 | Attend-and-Excite:基于注意力的文生图扩散模型语义指导
针对现有的扩散模型在文生图过程中会忽视promp中的一些物体(在多物体的情况下),或者对一些描述缺少约束(对某个物体的描述可能会错误分配到其他物体上)的问题,本文使用一个基于注意力的GSN,称之为Attend-and-Excite,引导模型细化交叉注意力单元,以关注文本提示中的所有主题并加强(或激发)它们的激活,从而鼓励模型生成文本提示中描述的所有主题。
用户1324186
2023-10-09
8380
文生图模型又“卷”起来了!比 Stable Diffusion 中文理解能力更强、更懂国人的文生图模型是如何构建的?
宋徽宗赵佶曾创作过一幅名为《蜡梅山禽图轴》的画作,并为该画题了一首诗:“山禽矜逸态,梅粉弄轻柔,已有丹青约,千秋指白头。”讲述的是一对白头翁立于这丹青笔墨的虚空中,没有风,没有阴影,没有俗世喧嚣、红尘侵染,一千年恩爱如初,一千年只不过黯淡些羽毛上的墨色,艺术比生命更长久。
深度学习与Python
2023-09-08
1.6K0
混元视频生成技术:基于扩散模型的文生视频与多场景应用
混元视频生成技术由王红法主导研发,基于扩散模型构建完整技术体系,针对文生视频领域数据稀缺、语义对齐难、画质待提升的三大瓶颈,分别通过强化时空建模、优化语义模型与语料、采用图视一体+生成式超分技术解决。该技术形成文生视频、图生视频等4大核心能力及风格化、跳舞视频等X种玩法,支持1k~4k分辨率生成,已被人民日报两会宣传片《江山如此多娇》采用,验证了其在官方宣传场景的可用性,且技术架构具备良好的迭代扩展能力,可适配更多垂直场景需求。
IT资讯研究所
2026-05-31
5780
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券