由于计算复杂度线性增长且状态维度固定,SSM 天然适合超长序列。Mamba 在实验中展现出对高达百万 token 上下文的有效处理能力,且随着上下文增长持续受益。
Transformer 推理需缓存随序列增长的 KV 矩阵,内存随长度线性增加;SSM 的推理状态尺寸固定,不随序列增长,因此在长上下文推理时内存占用显著更低。
借助 HiPPO 初始化与选择性机制,SSM 能够在数千个时间步的跨度上保持对关键信息的记忆。在 Long Range Arena 等专门测试长程依赖的基准上,SSM 在长序列任务中表现突出。