自回归模型按固定顺序逐元素生成,后一个元素依赖前一个,无法并行;扩散模型从整体噪声出发,通过多轮去噪并行地细化全部元素,生成时间主要取决于去噪步数而非序列长度。
自回归模型一旦输出某个 token 便难以回头修正,编辑通常需要重新生成后续内容;扩散模型天然支持双向信息与局部编辑,可只对目标区域重新去噪而不影响其余部分,在图像修复、代码填充等场景更自然。
自回归模型在文本、代码等离散序列任务上占据主导,扩散模型则在图像、视频、音频等连续信号生成上表现突出。近年来二者也在相互借鉴——扩散语言模型把扩散引入文本,而 Transformer 也被用作扩散模型的骨干,呈现出融合趋势。