DNA 序列是极长的离散数据,碱基之间的依赖关系可跨越数千乃至数百万个碱基。Transformer 的平方复杂度使其难以处理这种超长序列,而 SSM 的线性扩展天然契合基因组建模需求。
Mamba 在基因组序列建模实验中展现出对长达百万 token 序列的有效处理,且随上下文增长持续获益。在一项区分五种大型猿类(相似度约 99%)的下游物种分类任务中,Mamba 利用超长上下文的能力表现尤为突出。
除物种分类外,SSM 还被用于基因表达、蛋白质序列等生物学任务的建模。其线性复杂度与长程记忆能力,使其成为处理基因组尺度数据的有力工具。