当前主流文生图产品大多建立在潜在扩散架构之上。它们在潜空间中执行扩散,配合文本编码器与交叉注意力实现文本到图像的控制,从而在可控算力下获得高质量输出。开源的 Stable Diffusion 系列是这一路线的代表,被广泛用于设计、营销素材与概念图生产。
闭源产品在此之上叠加各自的专有技术。例如部分系统采用级联式扩散实现高分辨率输出,部分使用更强的文本编码器提升提示理解能力,还有产品通过整流流 Transformer 等新一代架构进一步提升真实感与提示遵循度。
同一套扩散范式还被扩展到视频与三维生成——在时间维度上扩展扩散过程以生成连贯短片,或用于三维模型与纹理生成。这意味着扩散模型正从单一的图像引擎,演进为支撑多模态内容生成的通用基础。