首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >状态空间模型 >状态空间模型为何能实现线性复杂度?

状态空间模型为何能实现线性复杂度?

词条归属:状态空间模型

1. 避免全局两两比对

Transformer 的自注意力需要对序列中每个 token 与其他所有 token 计算关系,形成长度为 N 的 N×N 注意力矩阵,因此复杂度为 O(N²)。SSM 不做全局比对,而是逐 token 更新固定维度状态,每个 token 的计算成本恒定。

2. 固定维度状态

SSM 的隐藏状态维度不随序列长度增长。处理 N 个 token 需要 N 步,每步成本相同,总复杂度因此为线性的 O(N)。这意味着序列长度翻倍时,计算量只翻倍,而非像 Transformer 那样增长为四倍。

3. 推理阶段的实际收益

线性复杂度在超长序列上优势尤为明显。当序列达到百万 token 级别时,Transformer 的平方复杂度在现有硬件上几乎不可行,而 SSM 的线性扩展使其能够处理基因组、长音频、长文档等超长输入。

相关文章
状态空间模型为视频世界模型解锁长期记忆
视频世界模型通过根据动作预测未来帧,为人工智能在动态环境中进行规划和推理开辟了广阔前景。近期,特别是视频扩散模型的进步,在生成逼真的未来序列方面展现出了惊人的能力。然而,一个重大瓶颈依然存在:长期记忆的维持。由于使用传统的注意力层处理长序列会产生高昂的计算成本,当前模型难以记住过去较远时间的事件和状态,这限制了它们执行需要持续理解复杂场景的任务的能力。
用户11764306
2026-03-17
3600
从线性注意力视角揭秘视觉Mamba,清华、阿里合作提出全新MILA模型
论文第一作者为清华大学自动化系博士生韩东辰,指导老师为黄高副教授。他的主要研究方向包括高效模型架构设计、多模态大模型等。
机器之心
2025-02-14
6510
告别 Transformer:Mamba 模型如何实现线性时间序列建模
在深度学习领域,Transformer 架构已成为处理序列数据的主流方法。然而,随着序列长度的增加,Transformer 在计算和内存方面的需求也急剧上升。为了解决这一问题,研究人员提出了 Mamba(Linear-Time Sequence Modeling with Selective State Spaces)模型,一种基于选择性状态空间(Selective State Space Model,SSM)的新型架构。本文将通俗易懂地介绍 Mamba 的原理、优势以及应用场景。
未名编程
2025-04-23
2.7K0
PCM:一种新型点云学习模型、引入状态空间模型Mamba高效全局建模(天工AI开源)
https://github.com/SkyworkAI/PointCloudMamba
AI进修生
2024-12-02
1.8K0
斯坦福祭出 CU-Mamba | 不仅具有通道感知,更是将双状态空间模型(SSM)框架融入到U-Net
图像恢复是数字图像处理中的基本任务,旨在从各种退化(如噪声、模糊和雨迹)损害的图像中重建高质量图像。最近的进展凸显了卷积神经网络(CNNs)[1, 2, 3]和基于Transformer的模型[4, 5, 6, 7]在此领域的有效性。CNN利用层次结构,擅长捕捉图像内的空间层次。Transformer模型最初是为自然语言处理设计的,但已经显示出对视觉理解的积极成果,例如Vision Transformer[8]。Transformer模型采用自注意力机制,特别擅长建模长距离依赖。这两种方法在许多图像恢复任务中均取得了最先进的结果[9, 10, 11]。
公众号-arXiv每日学术速递
2024-04-25
2.5K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券