首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >状态空间模型 >状态空间模型与 Transformer 注意力机制有何本质区别?

状态空间模型与 Transformer 注意力机制有何本质区别?

词条归属:状态空间模型

1. 计算范式的不同

Transformer 通过自注意力让每个 token 与序列中所有其他 token 直接比对,形成全局感受野,代价是 O(N²) 的平方复杂度。SSM 则通过逐 token 更新隐藏状态来压缩历史,不做全局两两比对,复杂度为线性的 O(N)。

2. 内容感知能力

Transformer 的注意力是输入相关的,能动态判断哪些 token 更重要。早期 SSM(如 S4)参数固定、对所有输入一视同仁,缺乏内容感知的选择性。Mamba 通过引入输入相关的选择性机制,弥补了这一短板,使模型能根据内容决定记住或遗忘哪些信息。

3. 各自的适用边界

Transformer 在需要精确跨 token 比对的任务(如多跳问答、结构化检索)上更强;SSM 在超长序列、推理效率敏感的场景下更有优势。当前不少架构选择将二者结合,以兼顾各自长处。

相关文章
27:大语言模型基础:Transformer注意力机制与自注意力公式详解
作者: HOS(安全风信子) 日期: 2026-03-07 主要来源平台: GitHub 摘要: 本文深入探讨Transformer注意力机制的核心原理,详细解析自注意力公式的推导和实现。通过数学公式和代码示例,我们揭示了注意力机制如何使模型能够捕捉序列数据中的长距离依赖关系,为大语言模型的强大性能奠定基础。文章结合《死亡笔记》中魅上照的严谨风格,展现了注意力机制的数学美感和技术价值,为理解和应用大语言模型提供了深入的技术洞察。
安全风信子
2026-03-18
1K0
深度学习核心模型架构解析:Transformer自注意力机制与Query-Key-Value投影的向量空间几何解释
2017年,Google团队在《Attention Is All You Need》论文中提出的Transformer架构,彻底颠覆了自然语言处理领域的游戏规则。如今八年过去,这一架构不仅成为GPT、BERT等大语言模型的核心基础,更在2025年的AI技术栈中展现出前所未有的统治力。与传统的循环神经网络(RNN)相比,Transformer最大的突破在于完全摒弃了序列处理的固有模式,通过自注意力机制实现了全局依赖关系的并行建模。
用户6320865
2025-08-27
2.2K0
SSM+扩散模型,竟造出一种全新的「视频世界模型」
在这个 AI 技术与应用大爆发的时代,我们最不缺的就是「热词」,从自回归到扩散模型,从注意力机制到状态空间模型,从思维链到推理模型…… 有时候,其中一些热词会聚拢一处,为 AI 世界创造出新的可能性。
机器之心
2025-06-10
5180
Vision Transformers 大有可为!
Transformers 是一个非常强大的深度学习模型,已经能够成为许多自然语言处理任务的标准,并准备彻底改变计算机视觉领域。
AI算法与图像处理
2021-04-21
8940
李飞飞团队将ViT用在机器人身上,规划推理最高提速512倍,还cue了何恺明的MAE
来源:量子位(公众号id:qbitai)本文约1100字,建议阅读5分钟本文为你介绍李飞飞团队的最新研究。 人类的预测能力+ViT,会产生什么样的化学反应? 会让机器人的行动规划能力又快又准。 这是李飞飞团队的最新研究——MaskViT,通过MVM,掩码视觉建模对Transformer进行预训练,从而建立视频预测模型。 结果显示,MaskViT不仅能生成256*256视频,还可以让机器人行动规划的推理速度最高提高了512倍。 来看看这是项什么样的研究? 从人类身上找灵感 神经科学领域的研究表明,
数据派THU
2022-07-04
4090
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券