首页
学习
活动
专区
圈层
工具
发布
技术百科首页 >状态空间模型 >状态空间模型的推理效率为何优于 Transformer?

状态空间模型的推理效率为何优于 Transformer?

词条归属:状态空间模型

1. 恒定的单步推理成本

Transformer 在自回归解码时,每生成一个新 token 都需基于缓存重新计算注意力,KV 缓存随序列增长,单步成本随上下文增大。SSM 每步只更新固定状态,单步成本恒定,与序列长度无关。

2. 无 KV 缓存增长

Transformer 推理需维护随序列线性增长的 KV 缓存,占用大量显存并受内存带宽制约。SSM 的推理状态尺寸固定,无需增长的缓存,因此内存读写更少。

3. 硬件利用率优势

Mamba 通过硬件感知算法优化 GPU 内存 IO,在片上 SRAM 完成扫描运算。在长序列场景下,Mamba 的生成吞吐量可达同规模 Transformer 的数倍。不过需注意,在较短序列(如 32K token 以下)上,由于 Transformer 拥有更成熟的硬件内核,实际耗时可能仍更快。

相关文章
加性注意力机制、训练推理效率优于其他Transformer变体,这个Fastformer的确够快
在过去的几年里,Transformer 及其变体在很多领域取得了巨大成功,但由于其复杂度与序列长度的二次方成正比,它的计算效率并不高。虽然之前已经有很多研究致力于 Transformer 的加速,但在遇到长序列时,这些方法要么低效,要么无效。
机器之心
2021-09-06
1.4K0
LSTM一作新作xLSTM架构:大幅领先Transformer和状态空间模型(SSM)
这篇论文介绍了一种名为xLSTM(Extended Long Short-Term Memory)的新型递归神经网络架构,旨在解决传统LSTM(Long Short-Term Memory)网络的一些局限性,并提高其在语言建模等任务中的性能。
zenRRan
2024-05-11
6.1K0
LSTM依然能打!最新xLSTM架构:怒超先进Transformer和状态空间模型(SSM)
LSTM( Long Short-Term Memory)最早源于20世纪90年代,为人工智能的发展做出了重要贡献。然而,随着Transformer技术的出现,LSTM逐渐淡出了人们的视野。那么,如果将 LSTM 扩展到数十亿个参数,利用LLM技术打破LSTM的局限性,LSTM在语言建模方面还能走多远呢?
ShuYini
2024-05-09
2.6K0
本周AI热点回顾:加性注意力机制、训练推理效率优于其他Transformer变体;深度学习的计算复杂度被生物碾压
加性注意力机制、训练推理效率优于其他Transformer变体,这个Fastformer的确够快
用户1386409
2021-09-27
7090
颠覆Transformer霸权!CMU普林斯顿推Mamba新架构,解决致命bug推理速度暴增5倍
2017年6月12日横空出世,让NLP直接变天,制霸自然语言领域多年的Transformer,终于要被新的架构打破垄断了。
新智元
2023-12-05
1.6K0
点击加载更多
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档
领券