首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >定义与探索化学空间:算法驱动分子发现的系统综述

定义与探索化学空间:算法驱动分子发现的系统综述

作者头像
DrugIntel
发布2026-07-29 20:35:07
发布2026-07-29 20:35:07
1100
举报

文献来源:Coley, C. W. (2021). Defining and Exploring Chemical Spaces. Trends in Chemistry, 3(2), 133–145. 作者单位:MIT 化学工程系 发表年份:2021年


一、为什么要读这篇文章?

1.1 背景:分子发现面临的根本性挑战

功能性分子的发现本质上是一个多目标优化问题。候选分子需要同时满足结合活性、选择性、溶解度、代谢稳定性、毒性等多个相互制约的性质要求。传统的高通量筛选(HTS)策略面临两大根本性瓶颈:

  1. 1. 规模问题:稳定有机小分子的理论数量远超太阳系中的原子数(约 10⁸⁰),而类药化学空间的估计规模在 10²³ 量级。即便每秒评估一百万个分子,穷举也需要数十亿年。
  2. 2. 效率问题:随机筛选的命中率极低(通常 1–3%),大量资源消耗在低价值的实验上。

这篇综述系统地梳理了如何通过算法——尤其是机器学习——定义探索化学空间,从而使分子发现过程更加高效、可操作化。

1.2 文章的核心框架

作者将整个问题抽象为对目标函数 f(x) 的优化,其中 x 是分子,属于某个离散或隐式空间 X:

代码语言:javascript
复制
分子发现 = 在化学空间 X 中,找到使 f(x) 最优的分子 x*

两个核心问题因此自然浮现:

  • 如何定义空间 X(What molecules to consider?)
  • 如何高效搜索 X(How to navigate?)

二、预定义有限化学空间:枚举与主动学习

2.1 通用分子数据库

当 X 已被预先枚举时,定义与探索两个阶段完全解耦。常用的通用化学空间数据库包括:

数据库

核心特征

规模(量级)

ZINC

商业可购分子

10⁸

PubChem

生物相关分子

10⁸

ChEMBL

具有生物活性数据的分子

10⁷

DrugBank

已批准或在研治疗分子

10⁴

GDB-17

穷举枚举所有≤17重原子有机小分子

1.66×10¹¹

GDB-17 的意义:由 Reymond 课题组完成,枚举了 1664 亿个结构,是迄今最系统的有机小分子空间枚举,为化学空间的理论边界研究提供了重要基准。

2.2 聚焦化学空间的定领域枚举

针对特定应用场景,研究者往往基于领域知识构建更聚焦的子空间:

  • 有机电子学:170 万个供体-桥接体-受体三元组(用于 OLED 筛选)
  • 氧化还原液流电池:280 万个过渡金属配合物
  • 太阳能储热材料:2300 亿个七取代二氢薁衍生物

这类空间的设计通常结合片段枚举(R 基替换)和反合成分析,确保分子结构具有更高的先验药化质量。

2.3 按需合成库(Make-on-Demand Libraries)

核心思想:将可合成性作为定义化学空间的首要约束,而非事后筛选。

典型实现方式:对所有可用起始原料的组合,应用少量(< 100 条)专家定义的单步反应模板,枚举所有可能产物。

代表库

  • Enamine REAL:由约 130 种反应类型生成,含 1.7 亿成员,报告合成成功率约 86%(51 个化合物验证集)
  • WuXi 虚拟库:30 种反应类型,17 亿成员,估计成功率 60–80%

局限性

  • • 反应模板的鲁棒性决定合成成功率上限
  • • 组合爆炸使完整枚举在更多合成步骤下不可行
  • • 反应条件(溶剂、温度、催化剂)的泛化性未被模板完全捕捉

机器学习反应预测模型(如神经网络,在常见反应类型基准上精度 > 90%)可用于提升枚举质量,同时预测区域/立体选择性。

2.4 有限空间的探索策略

2.4.1 穷举评估

对于小规模库(如 Drug Repurposing Hub,约 6000 个化合物),直接评估所有候选是可行的。大规模虚拙计算筛选的案例:

  • • Lyu 等人对 Enamine REAL 库中 1.38 亿化合物进行 D4 受体对接
  • • 后续研究已将规模推进至 10 亿以上分子

然而,作者明确指出:随着按需合成库规模超过 10¹²,即便是廉价的对接评估,穷举筛选也不是长期可行方案

2.4.2 贝叶斯优化(Bayesian Optimization, BO)

核心框架:主动学习驱动的迭代模型引导优化。

代码语言:javascript
复制
初始小批次实验 → 训练替代模型 f̂(x) → 采集函数选点 → 新实验 → 更新模型 → 循环

关键要素:

  • 替代模型(Surrogate Model):拟合 f(x) 的 QSPR 模型,常见选择包括高斯过程(GP)、图神经网络(GNN)
  • 采集函数(Acquisition Function):平衡探索(uncertainty)与利用(exploitation),如期望提升(EI)、置信上界(UCB)
  • 批量优化:适配实验室并行评估(多孔板、多 CPU)的实际需求

经典案例——Halicin 的发现(Stokes et al., Cell 2020):

训练数据仅 10⁴ 条实验记录(抑菌活性),使用有向消息传递神经网络(DMPNN)作为替代模型,对 ZINC15 数据库进行大规模预测,仅用一轮迭代便从中识别出新型抗生素 Halicin——其对多种耐药菌有效,且结构完全新颖,超出传统药化认知范畴。

当前挑战

  • • 替代模型在低数据场景下的泛化性
  • • 不确定性估计的可靠性(特别是分布外预测)
  • • 考虑实验成本异质性的批量采集策略

三、按需生成化学空间:遗传算法与深度生成模型

3.1 为什么需要按需生成?

即便对于贝叶斯优化,从 10¹²+ 分子空间中选点也需要等量的替代模型预测次数——这在计算预算有限时不可行。按需生成(on-the-fly generation)将定义探索融为一体,同时进行。

3.2 遗传算法(Genetic Algorithms, GAs)

基本原理

GA 是无模型、无梯度的优化方法,通过模拟自然选择对候选分子"种群"进行迭代进化:

代码语言:javascript
复制
初始化种群 → 评估适应度 f(x) → 选择 → 变异/交叉 → 新种群 → 循环
分子水平的操作算子

以 Molpher 框架为例,定义了以下原子/键级别的变异操作:

算子

操作描述

AA

添加原子(Add Atom)

RA

删除原子(Remove Atom)

AB

添加键(Add Bond)

RB

删除键(Remove Bond)

MA

变异原子类型(Mutate Atom)

IA

插入原子(Interject Atom)

BR

键重路由(Bond Reroute)

BC

键收缩(Bond Contraction)

交叉操作(Crossover):将两个母分子的子结构重新组合,实现结构信息的"基因重组"。

关键优势
  • • 研究表明,GA 通常只需相对少量的进化代数即可将任意分子转化为另一个分子,探索效率高
  • • 可轻松整合化学先验知识(如偏好特定片段库、禁止特定官能团)
  • • 与深度模型结合(如 GEGL:GA + 神经网络多样性引导)可进一步提升探索质量
代表工作
  • GraphGA(Jensen, Chem. Sci. 2019):基于分子图的 GA + 蒙特卡罗树搜索
  • BREED:通过已知活性配体的三维叠合进行结构杂交
  • GEGL:GA + 强化学习多样性奖励

3.3 深度生成模型

3.3.1 主要框架分类

基于 SMILES 字符串的方法

  • VAE(Variational Autoencoder):将分子编码至连续潜在空间,在潜在空间中优化后解码为新结构(Gómez-Bombarelli et al., ACS Cent. Sci. 2018)
  • RNN(循环神经网络):自回归生成 SMILES token 序列,可通过 RL 微调偏向目标性质

基于分子图的方法

  • JT-VAE(Junction Tree VAE):先生成分子的"结构树"(环/链的连接关系),再在其基础上完善原子细节,从根本上保证分子有效性(Jin et al., ICML 2018)
  • GCPN(Graph Convolutional Policy Network):强化学习智能体逐原子构建分子图

对抗与混合方法

  • AAE(Adversarial Autoencoder):用判别器替代 VAE 的 KL 散度损失
  • GAN-RL 混合:生成器负责分子生成,判别器评估"真实性",RL 信号来自属性预测
3.3.2 潜在空间优化

对于基于编解码器的模型,探索化学空间等价于在连续潜在空间 Z 中导航:

代码语言:javascript
复制
目标: max f(g(z)),其中 g: Z → 分子结构

优化方法包括:

  • • 贝叶斯优化于潜在空间(BO in latent space)
  • • 梯度上升(需要可微分的 f(x) 估计器)
  • • 加权重训练(Weighted Retraining):用高性能分子更新解码器权重
3.3.3 实验验证的稀缺性

文章特别指出:数百篇论文在计算基准上评估生成模型,但实验验证极为罕见。仅有的几个例外:

  1. 1. Polykovskiy et al.:生成模型提出 30 万个 JAK3 抑制剂候选,经对接→分子动力学→人工选择,最终仅验证 1 个分子
  2. 2. Zhavoronkov et al.(Insilico Medicine):生成 3 万个 DDR1 抑制剂候选,基于可合成性筛选至 6 个,实验验证 6 个均有活性
  3. 3. Sumita et al.:RL 生成模型 + DFT 计算,提出 3200 个特定吸收波长分子,86 个通过 DFT 验证,6 个成功合成

这种"漏斗式"损耗揭示了计算预测与实验现实之间的巨大鸿沟。


四、合成约束化学空间:弥合计算与实验的鸿沟

4.1 合成可行性:被忽视的核心约束

Gao & Coley(2020)通过数据驱动逆合成工具系统评估了主流生成模型的输出,发现大量"新颖"分子实际上难以或无法合成。合成不可行不仅意味着无法验证,更意味着整个发现流程的断链。

作者提出:合成约束应当被内嵌于生成过程,而非作为事后过滤步骤。

4.2 合成感知遗传算法

策略一:约束变异算子

  • CReM(Chemically Reasonable Mutations):基于从真实合成化合物中提取的碎片,确保每次变异产生化学合理的结构
  • Flux:将虚拟合成方案嵌入碎片生长过程

策略二:基于反应模板的从头设计(Reaction-based De Novo Design) 将 GA 的变异操作替换为反应模板的应用,候选分子通过模拟化学反应生成:

代码语言:javascript
复制
SYNOPSIS、DOGS、MOARF、LiGen

历史先例:Weber et al.(1995)通过 Ugi 四组分反应隐式定义 16 万成员空间,实验优化凝血酶抑制剂——这是合成约束分子优化的早期范例。

4.3 合成感知深度生成模型

这是文章最具前瞻性的部分,代表过去数年最重要的方法论进展:

MoleculeChef(Bradshaw et al., 2019)

核心创新:VAE 直接在反应物集合的空间中操作,而非分子结构空间。

代码语言:javascript
复制
潜在空间 z → 循环解码器 → 反应物集合 {R₁, R₂, ...} → 反应预测模型 → 产物 P
  • • 反应物从商业可购的起始原料离散列表中选取
  • • 使用 SMILES Transformer 预测单步反应产物
  • • 优化目标是产物的性质,但变量是反应物和合成路线
ChemBO(Korovina, 2019)

在合成图(synthesis graph)上进行随机游走:每次迭代采样新起始原料并模拟反应,替代模型 f̂(x) 选择最优产物进行完整评估。本质上是在不断增长的合成可及化学空间上做贝叶斯优化。

PGFS 与 REACTOR(两篇 2020 年论文)

将化学空间探索建模为马尔可夫决策过程(MDP)

代码语言:javascript
复制
状态 s:当前分子中间体
动作 a:选择反应模板(+ 第二反应物)
奖励 r:产物性质 f(x)
策略 π:神经网络参数化的 RL 智能体

两者的区别在于第二反应物的选取方式(PGFS 主动选择,REACTOR 穷举枚举)。随着训练进行,智能体的策略持续更新以奖励产生更高性能分子的合成路径。

4.4 方法对比总结

维度

预定义空间 + BO

遗传算法

深度生成模型

合成约束生成

空间大小

有限(10⁶–10¹⁰)

隐式(极大)

隐式(极大)

隐式但合成可及

合成可行性

可内嵌

需额外约束

通常较差

内嵌

样本效率

高(BO引导)

中等

依赖基准

中等

探索多样性

受库限制

较好

较好

受反应模板限制

实验验证

有成功案例

较少

极少

极少

计算成本

低–中

低–中


五、前沿议题与开放问题

5.1 闭环自动化实验室

将计算实验设计算法与机器人实验室集成("closing the loop")是加速科学发现的重要范式。文章指出:

  • • 具备高通量筛选能力但无法合成的平台,只能探索预定义空间
  • • 能执行单步简单化学的平台,可枚举对应化学空间并用 BO 选点
  • • 具备多步自动合成与纯化的平台(尚处概念验证阶段),理论上能探索几乎任意按需生成的合成可及空间

Coley et al.(Science 2019)报告了 AI 规划引导的流动化学机器人合成平台,是这一方向的重要里程碑。

5.2 立体化学的处理

现有生成模型(基于 SMILES 或分子图)在立体化学处理上存在根本性局限:

  • • SMILES 和图表示无法有效区分超过四面体手性和顺/反键异构之外的构型异构体(如阻转异构体、螺旋构象)
  • • 即便是对四面体手性,大多数模型也仅能机械处理,缺乏真正的立体化学"理解"
  • • 三维坐标生成模型(如 Simm & Hernández-Lobato 的生成模型)理论上可克服这一问题,但设计目标对立体化学敏感的案例研究几乎缺失

5.3 设计目标的真实性

当前计算基准大多使用可计算的启发式指标(如 QED、SA Score、logP、对接分数),而非真实的生物活性。问题在于:

  • • 这些指标对分子结构高度平滑,算法"太容易"取得好成绩
  • • 不能揭示真实场景下的失效模式
  • • 不惩罚样本低效性

作者呼吁建立新一代基准,需满足:

  1. 1. 具有非平滑、多局部最优、多目标权衡的复杂设计目标
  2. 2. 要求生成具体立体异构体
  3. 3. 包含样本效率指标
  4. 4. 引入候选分子可变实验成本

5.4 人机协作的不可替代性

文章以一段颇具哲学意味的段落收尾:计算流程不应为存在而存在,而应赋能研究者触达否则无法抵达的发现空间。在可以用领域知识缩小问题相关化学空间的情形下,应优先利用专家直觉;人工对候选分子的筛选与判断,在计算预测与物理实验之间始终扮演不可或缺的中间角色。


小结

这篇综述提供了一套清晰、统一的概念框架,将分子发现领域分散的方法论整合进一个连贯的叙事:化学空间的定义与探索,是所有计算分子设计方法的共同底层逻辑。

文章的独特贡献

  • • 将合成可行性置于中心位置,而非边缘约束——这在 2021 年是相当前瞻的判断
  • • 清晰区分了"空间定义"与"空间探索",避免了领域内常见的概念混淆
  • • 在对方法进行分类的同时,诚实指出了每类方法的局限与当前缺口

主要局限

  • • 综述仅涵盖小分子,未涉及多肽、大环、PROTACs 等新兴模式
  • • 发表于 2021 年,未能涵盖此后大语言模型(如 ChemBERTa、MolT5)在分子生成中的应用
  • • 对实验验证标准的讨论相对宏观,缺少对成功率定量分析的深入展开

对于任何从事 AI 驱动药物/材料发现的研究者而言,这篇文章是值得读的方法论基础文献

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-28,如有侵权请联系 cloudcommunity@tencent.com 删除
目录
  • 一、为什么要读这篇文章?
    • 1.1 背景:分子发现面临的根本性挑战
    • 1.2 文章的核心框架
  • 二、预定义有限化学空间:枚举与主动学习
    • 2.1 通用分子数据库
    • 2.2 聚焦化学空间的定领域枚举
    • 2.3 按需合成库(Make-on-Demand Libraries)
    • 2.4 有限空间的探索策略
      • 2.4.1 穷举评估
      • 2.4.2 贝叶斯优化(Bayesian Optimization, BO)
  • 三、按需生成化学空间:遗传算法与深度生成模型
    • 3.1 为什么需要按需生成?
    • 3.2 遗传算法(Genetic Algorithms, GAs)
      • 基本原理
      • 分子水平的操作算子
      • 关键优势
      • 代表工作
    • 3.3 深度生成模型
      • 3.3.1 主要框架分类
      • 3.3.2 潜在空间优化
      • 3.3.3 实验验证的稀缺性
  • 四、合成约束化学空间:弥合计算与实验的鸿沟
    • 4.1 合成可行性:被忽视的核心约束
    • 4.2 合成感知遗传算法
    • 4.3 合成感知深度生成模型
      • MoleculeChef(Bradshaw et al., 2019)
      • ChemBO(Korovina, 2019)
      • PGFS 与 REACTOR(两篇 2020 年论文)
    • 4.4 方法对比总结
  • 五、前沿议题与开放问题
    • 5.1 闭环自动化实验室
    • 5.2 立体化学的处理
    • 5.3 设计目标的真实性
    • 5.4 人机协作的不可替代性
  • 小结
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档