SSM 将全部历史压缩进固定维度状态,这使其在需要精确、结构化检索长上下文中任意内容的任务上弱于 Transformer——后者可通过重访完整 KV 缓存实现精确召回。Mamba-3 在真实检索任务上"有竞争力但非全面领先",在半结构化信息抽取上仍弱于 Transformer。
早期 SSM 因实数状态、一阶离散化等限制,在状态跟踪、逻辑推理、精确位置感知等任务上明显弱于 Transformer。Mamba-2 在奇偶检测等状态跟踪任务上近乎随机水平,直到 Mamba-3 引入复值状态才将该任务准确率提升至接近满分。
在较短序列(如 32K token 以下)任务上,Transformer 凭借更成熟的硬件内核和社区生态,实际表现与效率仍占优。SSM 的工具链、训练稳定性与大规模预训练经验仍在持续完善中,当前更现实的路径是混合架构,而非完全替代 Transformer。