Transformer 通过自注意力让每个 token 与序列中所有其他 token 直接比对,形成全局感受野,代价是 O(N²) 的平方复杂度。SSM 则通过逐 token 更新隐藏状态来压缩历史,不做全局两两比对,复杂度为线性的 O(N)。
Transformer 的注意力是输入相关的,能动态判断哪些 token 更重要。早期 SSM(如 S4)参数固定、对所有输入一视同仁,缺乏内容感知的选择性。Mamba 通过引入输入相关的选择性机制,弥补了这一短板,使模型能根据内容决定记住或遗忘哪些信息。
Transformer 在需要精确跨 token 比对的任务(如多跳问答、结构化检索)上更强;SSM 在超长序列、推理效率敏感的场景下更有优势。当前不少架构选择将二者结合,以兼顾各自长处。