混合专家(Mixture of Experts,MoE)通过路由器为每个 token 只激活部分"专家"网络,在扩大参数规模的同时控制计算量,是千亿、万亿参数模型的常用架构。
将 Transformer 注意力层、Mamba(SSM)层与 MoE 层结合,可形成"三重混合"架构。AI21 Labs 的 Jamba 是较早的生产级代表:它在 72 层中交错排列 Transformer 与 Mamba 层,并引入 MoE 路由,支持 256K token 上下文,在长上下文基准上取得领先结果,同时保持接近更小纯注意力模型的推理效率。
NVIDIA 推出的 Nemotron-H 系列(涵盖 8B、47B、56B 参数规模)也是混合 Mamba-Transformer 架构的代表,验证了 SSM 与注意力、MoE 结合在企业级部署中的可行性。这类混合设计让 SSM 的高效长序列处理能力与注意力的精确检索、MoE 的参数效率互补。