文本到图像模型首先用文本编码器把提示词转换为高维向量序列。常用编码器为 CLIP 的文本塔,它通过对比学习在海量图文对上训练,能将语义相近的文字与图像映射到接近的空间;部分模型也采用 T5 等纯语言模型作为编码器。
文本向量通过 U-Net 或 Transformer 中的交叉注意力层注入去噪过程。在每一步去噪时,图像特征作为查询,文本向量作为键和值,使生成过程受到语义约束,从而让"金毛犬穿宇航服"这类描述真正引导噪声向对应图像收敛。
Classifier-Free Guidance(CFG)是当前条件生成的标准手段。训练时随机丢弃文本条件,使模型同时学会条件生成与无条件生成;推理时将两者预测按引导尺度 w 加权组合,放大文本条件的影响。w = 1 表示无引导,常用范围为 7~12,w 越大图像越贴合描述但多样性有所下降。