首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >扩散模型 >扩散语言模型与自回归大语言模型有何不同?

扩散语言模型与自回归大语言模型有何不同?

词条归属:扩散模型

1. 生成方式本质不同

自回归大语言模型按从左到右的顺序逐个预测 token,每一步都依赖前序 token,生成时间随序列长度线性增长。扩散语言模型(Diffusion Language Model, dLLM)则借鉴图像扩散思路,从一段被掩码或加噪的序列出发,在多轮去噪中并行地细化和填充多个位置的 token。

2. 并行生成与双向上下文

由于扩散语言模型在去噪时能同时"看到"整段序列,它具备双向上下文,生成不受严格因果顺序约束,可在多个位置并行更新。这使其在代码填充、内联编辑、约束满足等需要双向信息的任务上具有结构性优势。

3. 速度与质量的权衡

扩散语言模型以较少的去噪轮次并行生成整块 token,推理速度可显著快于同规模的自回归模型。当前代表性工作包括开源的 DiffusionGemma、学术界的 LLaDA 系列,以及 Mercury 等商业系统和 Gemini Diffusion 等实验性研究预览。不过在长文本连贯性与复杂推理上,扩散语言模型仍略逊于成熟的自回归模型,二者更多是互补而非替代关系。

相关文章
dLLM:复用自回归模型权重快速训练扩散语言模型
大语言模型的文本生成方式一直都是以自回归为主:一个token接一个token,从左往右,生成完就定了。
deephub
2025-12-30
5090
突破性进展:简单有效的新型Masked扩散模型革新语言生成,与自回归模型媲美
文章旨在解决扩散模型(diffusion models)在生成高质量图像方面表现出色,但在语言建模(language modeling)任务中与自回归(autoregressive, AR)方法存在显著性能差距的问题。作者指出,尽管扩散模型在生成离散数据(如文本、生物序列和图)方面具有潜力,但在语言建模的性能上,与AR方法相比,先前工作的扩散模型报告了较大的对数似然差距。
zenRRan
2024-06-18
1.2K0
彻底抛弃自回归?谷歌发布扩散架构文本大模型
随机比特
2026-06-24
1350
R语言时间序列TAR阈值自回归模型
这些模型捕获了线性时间序列模型无法捕获的行为,例如周期,幅度相关的频率和跳跃现象。Tong和Lim(1980)使用阈值模型表明,该模型能够发现黑子数据出现的不对称周期性行为。 一阶TAR模型的示例:
拓端
2025-01-09
4060
R语言实现向量自回归VAR模型
澳大利亚在2008 - 2009年全球金融危机期间发生了这种情况。澳大利亚政府发布了一揽子刺激计划,其中包括2008年12月的现金支付,恰逢圣诞节支出。因此,零售商报告销售强劲,经济受到刺激。因此,收入增加了。
拓端
2020-09-26
1.7K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券