
DRUGONE
序列—功能模型能够根据DNA序列预测基因表达、染色质可及性和表观遗传修饰,已经成为解析人类调控基因组的重要工具。然而,现有先进模型通常只学习DNA序列与训练数据中既定细胞类型之间的对应关系,难以将预测能力推广到训练时未见的新细胞类型或新生理状态。根本原因在于,相同DNA序列会在不同细胞环境中被不同的调控因子解读,而仅使用序列的模型无法感知这种生物学背景。
研究人员提出上下文感知序列—功能模型Corgi,将DNA序列与反式调控因子的表达信息联合建模。模型以转录因子、转录共激活因子、染色质修饰因子和RNA结合蛋白的表达水平描述细胞状态,并预测RNA测序、染色质可及性、DNA甲基化及多种组蛋白修饰信号。Corgi在训练中未见的细胞类型和基因组区域上仍具有较高准确度。研究人员进一步开发了Corgi+,利用RNA测序数据推断缺失的表观基因组轨迹,在跨细胞类型数据插补任务中超过已有模型。此外,模型能够以零样本方式识别细胞类型特异性调控因子,并预测训练中未见组织中的表达数量性状位点效应。

基因组学的核心目标之一,是理解相同的人类基因组如何在不同细胞中产生截然不同的功能输出。虽然不同细胞基本共享同一套DNA序列,但神经细胞、肝细胞、心肌细胞和干细胞会激活不同的调控元件,形成不同的染色质状态和基因表达程序。这说明基因调控不仅由DNA中的顺式调控序列决定,还取决于细胞内转录因子、染色质修饰因子、转录共激活因子和RNA结合蛋白等反式调控成分。
传统序列—功能模型主要以DNA序列作为唯一输入。通过在大量功能基因组数据上训练,这些模型能够学习启动子、增强子和转录因子结合位点等调控语法,并预测新DNA序列的功能。然而,这类模型本质上缺少细胞上下文:同一段DNA在某个细胞中可能高度活跃,在另一细胞中却完全沉默,而单纯依赖序列的模型无法解释这一差异。因此,它们通常只能为训练过程中包含的细胞类型设置独立输出通道,难以直接推广到新的细胞类型或生物学条件。
已有研究开始将转录因子表达、染色质可及性或单细胞多组学信息作为上下文输入,但仍存在预测任务类型有限、依赖已知转录因子结合基序、分辨率不足或模型性能偏低等问题。另一个关键困难在于,DNA序列是具有长度和特征两个维度的空间表示,而细胞状态通常是一个一维表达向量,如何有效融合两者尚未形成统一方案。
研究人员据此设计Corgi,即“上下文感知调控基因组推断”模型。其基本思想与细胞中的真实调控过程相似:DNA中的调控元件只有在相应反式调控因子存在时才会发挥作用。因此,模型不再孤立读取DNA,而是根据当前细胞中调控因子的表达状态,动态改变对顺式调控序列的解释。Corgi最终能够预测16类实验对应的基因组信号,包括RNA表达、染色质可及性、DNA甲基化及多种组蛋白修饰。
方法
研究人员汇集ENCODE、FANTOM5、Tabula Sapiens和CATlas等资源中的批量与单细胞数据,构建包含580个生物样本的训练集合。模型输入由524 kb的DNA序列和2891个反式调控基因的表达向量组成,这些基因涵盖转录因子、转录共激活因子、染色质修饰因子和RNA结合蛋白。DNA序列首先经过卷积与池化操作,形成局部顺式调控特征;表达向量则经多层感知机转换为反式调控特征。随后,特征线性调制层根据反式调控状态,对顺式特征进行逐通道调整,使不同细胞能够以不同方式解释同一DNA序列。多个Transformer层进一步捕获增强子—启动子等远距离调控关系,最终以64 bp分辨率预测中央393 kb区域内的多类功能基因组轨迹。为严格检验泛化能力,研究人员分别设置跨细胞类型、跨DNA序列以及同时跨细胞类型和序列三种测试模式,并确保相似组织和重叠序列不会同时进入训练集与测试集。
结果
Corgi通过顺式—反式融合模拟细胞基因调控
Corgi的结构明确区分顺式调控信息和反式调控环境。卷积网络负责识别DNA中的局部序列模式,多层感知机则压缩细胞内反式调控因子的表达信息。特征线性调制层根据当前细胞环境改变序列特征的强度,可以被理解为对“结合亲和力与调控因子浓度共同决定功能”的计算模拟。
这种调制不仅发生在早期卷积层,也嵌入后续Transformer模块,因此细胞上下文既能影响局部基序识别,也能影响长距离基因组相互作用。与依赖已知转录因子基序的方法相比,Corgi允许全部反式调控因子参与特征学习,不需要预先规定某一转录因子必须结合何种序列。

图1:Corgi模型架构及其与细胞基因调控过程的对应关系,包括顺式特征提取、反式调控状态编码、特征线性调制和长距离基因组建模。
模型能够泛化到未知细胞类型和未知序列
在跨细胞类型测试中,Corgi使用训练时见过的DNA区域预测全新的细胞环境。模型对DNase测序轨迹的平均相关性达到0.84,对批量RNA测序达到0.79,对DNA甲基化达到0.92。不同组蛋白修饰的预测难度存在差异,其中与活性启动子相关的修饰通常比异染色质相关修饰更容易预测。
在同时面对未知细胞类型和未知DNA序列的严格测试中,Corgi仍保持稳定性能。DNase测序相关性达到0.76,RNA测序达到0.69,DNA甲基化达到0.93。基因层面的表达预测更加稳定,在三种测试设置中的相关性均约为0.85以上,说明模型并未依赖某个特定细胞或基因组区域进行记忆。
在SESN1基因附近的实例中,模型不仅重建了尖锐的染色质可及性峰,还能够恢复较宽的组蛋白修饰区域、转录起始位点、RNA测序中的外显子—内含子边界和局部DNA甲基化模式。在SFRP1区域,模型进一步正确预测了该基因在神经祖细胞中的特异性高表达。

图2:Corgi在跨细胞类型、跨序列及同时跨细胞类型和序列任务中的性能,以及SESN1和SFRP1基因区域的预测实例。
Corgi超过现有上下文感知模型
研究人员将Corgi与EpiGePT进行比较。尽管EpiGePT在其训练集中包含部分测试组织,并借助已知转录因子基序计算结合亲和力,Corgi仍在多种表观基因组轨迹上取得明显优势。所有样本和轨迹汇总后,Corgi的平均相关性约为0.426,而EpiGePT约为0.218。基因组浏览器结果还显示,EpiGePT的预测噪声更高,部分DNase高敏感区域未被准确识别。
在仅测试未知DNA序列的条件下,Corgi与非上下文模型Borzoi在多数基因组轨迹上的总体表现接近。Borzoi在基因层面RNA表达预测中略有优势,但无法直接预测训练集中未包含的细胞类型。由此可见,Corgi在保持先进序列模型精度的同时,额外获得了跨细胞环境泛化能力。

图3:Corgi与EpiGePT及Borzoi的性能比较,以及代表性染色质可及性区域的预测差异。
Corgi+实现RNA驱动的表观基因组插补
实际功能基因组研究中,可能的“细胞类型—实验类型”组合数量极其庞大,仅有一小部分经过实验测量。研究人员因此开发Corgi+,利用某个细胞类型已有的RNA测序数据,推断其缺失的染色质可及性和组蛋白修饰轨迹。
Corgi+在原模型基础上加入局部RNA覆盖信号、训练细胞中的平均表观基因组基线,以及针对细胞特异性变化设计的训练目标。研究发现,平均基线对预测原始信号非常有效,因为不同细胞之间共享大量稳定的调控区域。但真正有生物学意义的是某一细胞相对于平均状态的升高或降低,Corgi+在预测这些细胞特异性变化方面表现最佳。
在14种未见细胞和组织中,Corgi+在12类轨迹中的11类超过Avocado或EpiGePT。去除特征线性调制后,多数轨迹的性能下降,证明全局反式调控因子表达确实提供了局部RNA信号之外的重要信息。研究结果表明,Corgi+已达到RNA到表观基因组数据插补的先进水平。

图4:Corgi+的表观基因组插补设置,与Corgi、EpiGePT和Avocado等模型的预测性能比较。
模型以零样本方式识别细胞特异性调控因子
为了理解模型如何利用细胞环境,研究人员分别计算DNA序列侧的顺式贡献和反式调控因子表达侧的贡献。在诱导多能干细胞中,POU5F1和NANOG等干性因子位居主要贡献者;在肝脏中,模型识别出多种肝细胞核因子;在神经祖细胞中,SOX2、SOX11和OTX2等神经发育因子贡献突出;在睾丸中,则识别出DAZL和BRDT等精子发生相关基因。
这些细胞类型在训练阶段均被保留为未知环境,因此模型是在零样本条件下识别其核心调控因子。多数关键基因的表达量与反式贡献得分在不同细胞间呈正相关,但这种关系并不是对表达量的简单复制。贡献分析显示,模型学习到的是调控因子在特定上下文中的功能重要性。

图5:不同细胞类型中的顺式和反式贡献分析,以及Corgi+零样本识别关键调控因子的结果。
虚拟敲除揭示顺式与反式调控联系
Corgi允许分别修改DNA序列和反式调控因子表达,因此研究人员进行了两类虚拟敲除:一类将DNA上的目标转录因子结合位点替换为随机序列,另一类降低对应转录因子的表达。结果显示,两种敲除在基因组范围内产生的影响总体呈较弱但稳定的正相关。
在部分区域,两种操作影响了相同的基因组区段。例如在肝脏APOE基因座附近,无论破坏潜在结合位点还是降低相应调控因子表达,模型预测的H3K27ac信号都会在相似区域发生变化。这为模型内部的顺式—反式耦合提供了自洽证据。不过,由于缺少真实敲除数据,这些结果只能说明模型内部的一致性,不能证明其已能准确预测真实干预结果。

图6:顺式结合位点敲除和反式调控因子敲除的影响比较,以及APOE基因座的预测实例。
Corgi预测未知组织中的遗传变异效应
研究人员进一步使用来自多个组织的精细定位表达数量性状位点,测试Corgi对遗传变异效应的预测能力。模型分别输入参考等位基因和替代等位基因序列,并以两次输出之差估计变异影响。结果显示,无论组织是否出现在训练数据中,模型预测均与实际效应显著相关。
随着变异与目标基因转录起始位点之间距离增加,RNA通道的预测性能逐渐下降,反映出当前序列模型普遍难以捕获远端增强子效应。相比之下,组蛋白修饰通道在远距离变异上更加稳定。将RNA与多种组蛋白轨迹组合后,可以兼顾近距离RNA信号的优势和远距离表观遗传信号的稳健性。
当研究人员故意使用错误细胞类型的反式调控表达进行预测时,变异效应预测性能明显下降。这说明Corgi并非只根据DNA序列判断变异影响,而是能够利用正确的细胞环境,预测具有组织特异性的调控效应。

图7:Corgi在训练组织和保留组织中的表达数量性状位点效应预测、不同距离下的性能变化及错误细胞上下文对预测的影响。
讨论
Corgi将序列—功能建模从“DNA序列决定功能”推进到“DNA序列与细胞上下文共同决定功能”。这种框架使模型能够在保持传统序列模型预测精度的同时,推广到训练阶段未见的细胞类型,并统一预测基因表达、染色质可及性、DNA甲基化和多种组蛋白修饰。
与为每个实验设置独立输出通道的多任务模型相比,上下文感知模型能够更有组织地利用不同细胞之间共享的调控规律。相同的DNA编码器可以与任意细胞的反式调控状态组合,理论上能够显著扩展可预测的细胞—实验空间。不过,多任务模型一次前向计算即可同时输出多个已知细胞中的结果,在大规模变异扫描中可能更具计算效率,而且可以利用更多跨物种和转录因子结合数据。
Corgi将反式调控因子的表达作为细胞状态表示,具有较好的可解释性与实验可操作性。与抽象细胞嵌入不同,研究人员可以直接改变某个调控因子的输入表达,模拟过表达或敲低。然而,Corgi目前对单个反式因子扰动并不敏感,也无法准确预测细胞在扰动后经过反馈调节形成的新稳定状态。这可能源于输入维度较高、单基因变化被稀释,以及模型没有显式描述调控网络中的间接效应。
模型还未纳入微RNA和长链非编码RNA,也没有直接使用转录因子结合实验或扰动单细胞数据。更重要的是,当前模型主要学习统计关联,而非真正的因果调控关系。未来的序列—功能模型需要进一步整合转录因子结合、Perturb-seq和药物干预数据,从而学习反式调控因子丰度、DNA结合、染色质变化和基因表达之间的因果链条。
总体而言,Corgi证明了将DNA序列与可解释的细胞状态联合建模,可以突破传统序列模型受限于固定细胞类型的瓶颈。Corgi+则展示了利用易获得的RNA测序数据补全昂贵表观基因组实验的应用价值。下一阶段的发展方向,将是从上下文感知的序列—功能模型进一步迈向能够预测遗传与药物扰动结果的因果序列—功能模型。
整理 | DrugOne团队
参考资料
Aksu, E.D., Vingron, M. Context-aware sequence-to-function model of human gene regulation. Nat Commun 17, 6200 (2026).
https://doi.org/10.1038/s41467-026-75527-2

内容为【DrugOne】公众号原创|转载请注明来源