Transformer 在自回归解码时,每生成一个新 token 都需基于缓存重新计算注意力,KV 缓存随序列增长,单步成本随上下文增大。SSM 每步只更新固定状态,单步成本恒定,与序列长度无关。
Transformer 推理需维护随序列线性增长的 KV 缓存,占用大量显存并受内存带宽制约。SSM 的推理状态尺寸固定,无需增长的缓存,因此内存读写更少。
Mamba 通过硬件感知算法优化 GPU 内存 IO,在片上 SRAM 完成扫描运算。在长序列场景下,Mamba 的生成吞吐量可达同规模 Transformer 的数倍。不过需注意,在较短序列(如 32K token 以下)上,由于 Transformer 拥有更成熟的硬件内核,实际耗时可能仍更快。