自回归大语言模型按从左到右的顺序逐个预测 token,每一步都依赖前序 token,生成时间随序列长度线性增长。扩散语言模型(Diffusion Language Model, dLLM)则借鉴图像扩散思路,从一段被掩码或加噪的序列出发,在多轮去噪中并行地细化和填充多个位置的 token。
由于扩散语言模型在去噪时能同时"看到"整段序列,它具备双向上下文,生成不受严格因果顺序约束,可在多个位置并行更新。这使其在代码填充、内联编辑、约束满足等需要双向信息的任务上具有结构性优势。
扩散语言模型以较少的去噪轮次并行生成整块 token,推理速度可显著快于同规模的自回归模型。当前代表性工作包括开源的 DiffusionGemma、学术界的 LLaDA 系列,以及 Mercury 等商业系统和 Gemini Diffusion 等实验性研究预览。不过在长文本连贯性与复杂推理上,扩散语言模型仍略逊于成熟的自回归模型,二者更多是互补而非替代关系。