

文献来源:Coley, C. W. (2021). Defining and Exploring Chemical Spaces. Trends in Chemistry, 3(2), 133–145. 作者单位:MIT 化学工程系 发表年份:2021年
功能性分子的发现本质上是一个多目标优化问题。候选分子需要同时满足结合活性、选择性、溶解度、代谢稳定性、毒性等多个相互制约的性质要求。传统的高通量筛选(HTS)策略面临两大根本性瓶颈:
这篇综述系统地梳理了如何通过算法——尤其是机器学习——定义和探索化学空间,从而使分子发现过程更加高效、可操作化。
作者将整个问题抽象为对目标函数 f(x) 的优化,其中 x 是分子,属于某个离散或隐式空间 X:
分子发现 = 在化学空间 X 中,找到使 f(x) 最优的分子 x*两个核心问题因此自然浮现:
当 X 已被预先枚举时,定义与探索两个阶段完全解耦。常用的通用化学空间数据库包括:
数据库 | 核心特征 | 规模(量级) |
|---|---|---|
ZINC | 商业可购分子 | 10⁸ |
PubChem | 生物相关分子 | 10⁸ |
ChEMBL | 具有生物活性数据的分子 | 10⁷ |
DrugBank | 已批准或在研治疗分子 | 10⁴ |
GDB-17 | 穷举枚举所有≤17重原子有机小分子 | 1.66×10¹¹ |
GDB-17 的意义:由 Reymond 课题组完成,枚举了 1664 亿个结构,是迄今最系统的有机小分子空间枚举,为化学空间的理论边界研究提供了重要基准。
针对特定应用场景,研究者往往基于领域知识构建更聚焦的子空间:
这类空间的设计通常结合片段枚举(R 基替换)和反合成分析,确保分子结构具有更高的先验药化质量。
核心思想:将可合成性作为定义化学空间的首要约束,而非事后筛选。
典型实现方式:对所有可用起始原料的组合,应用少量(< 100 条)专家定义的单步反应模板,枚举所有可能产物。
代表库:
局限性:
机器学习反应预测模型(如神经网络,在常见反应类型基准上精度 > 90%)可用于提升枚举质量,同时预测区域/立体选择性。
对于小规模库(如 Drug Repurposing Hub,约 6000 个化合物),直接评估所有候选是可行的。大规模虚拙计算筛选的案例:
然而,作者明确指出:随着按需合成库规模超过 10¹²,即便是廉价的对接评估,穷举筛选也不是长期可行方案。
核心框架:主动学习驱动的迭代模型引导优化。
初始小批次实验 → 训练替代模型 f̂(x) → 采集函数选点 → 新实验 → 更新模型 → 循环关键要素:
经典案例——Halicin 的发现(Stokes et al., Cell 2020):
训练数据仅 10⁴ 条实验记录(抑菌活性),使用有向消息传递神经网络(DMPNN)作为替代模型,对 ZINC15 数据库进行大规模预测,仅用一轮迭代便从中识别出新型抗生素 Halicin——其对多种耐药菌有效,且结构完全新颖,超出传统药化认知范畴。
当前挑战:
即便对于贝叶斯优化,从 10¹²+ 分子空间中选点也需要等量的替代模型预测次数——这在计算预算有限时不可行。按需生成(on-the-fly generation)将定义与探索融为一体,同时进行。
GA 是无模型、无梯度的优化方法,通过模拟自然选择对候选分子"种群"进行迭代进化:
初始化种群 → 评估适应度 f(x) → 选择 → 变异/交叉 → 新种群 → 循环以 Molpher 框架为例,定义了以下原子/键级别的变异操作:
算子 | 操作描述 |
|---|---|
AA | 添加原子(Add Atom) |
RA | 删除原子(Remove Atom) |
AB | 添加键(Add Bond) |
RB | 删除键(Remove Bond) |
MA | 变异原子类型(Mutate Atom) |
IA | 插入原子(Interject Atom) |
BR | 键重路由(Bond Reroute) |
BC | 键收缩(Bond Contraction) |
交叉操作(Crossover):将两个母分子的子结构重新组合,实现结构信息的"基因重组"。
基于 SMILES 字符串的方法:
基于分子图的方法:
对抗与混合方法:
对于基于编解码器的模型,探索化学空间等价于在连续潜在空间 Z 中导航:
目标: max f(g(z)),其中 g: Z → 分子结构优化方法包括:
文章特别指出:数百篇论文在计算基准上评估生成模型,但实验验证极为罕见。仅有的几个例外:
这种"漏斗式"损耗揭示了计算预测与实验现实之间的巨大鸿沟。
Gao & Coley(2020)通过数据驱动逆合成工具系统评估了主流生成模型的输出,发现大量"新颖"分子实际上难以或无法合成。合成不可行不仅意味着无法验证,更意味着整个发现流程的断链。
作者提出:合成约束应当被内嵌于生成过程,而非作为事后过滤步骤。
策略一:约束变异算子
策略二:基于反应模板的从头设计(Reaction-based De Novo Design) 将 GA 的变异操作替换为反应模板的应用,候选分子通过模拟化学反应生成:
SYNOPSIS、DOGS、MOARF、LiGen历史先例:Weber et al.(1995)通过 Ugi 四组分反应隐式定义 16 万成员空间,实验优化凝血酶抑制剂——这是合成约束分子优化的早期范例。
这是文章最具前瞻性的部分,代表过去数年最重要的方法论进展:
核心创新:VAE 直接在反应物集合的空间中操作,而非分子结构空间。
潜在空间 z → 循环解码器 → 反应物集合 {R₁, R₂, ...} → 反应预测模型 → 产物 P在合成图(synthesis graph)上进行随机游走:每次迭代采样新起始原料并模拟反应,替代模型 f̂(x) 选择最优产物进行完整评估。本质上是在不断增长的合成可及化学空间上做贝叶斯优化。
将化学空间探索建模为马尔可夫决策过程(MDP):
状态 s:当前分子中间体
动作 a:选择反应模板(+ 第二反应物)
奖励 r:产物性质 f(x)
策略 π:神经网络参数化的 RL 智能体两者的区别在于第二反应物的选取方式(PGFS 主动选择,REACTOR 穷举枚举)。随着训练进行,智能体的策略持续更新以奖励产生更高性能分子的合成路径。
维度 | 预定义空间 + BO | 遗传算法 | 深度生成模型 | 合成约束生成 |
|---|---|---|---|---|
空间大小 | 有限(10⁶–10¹⁰) | 隐式(极大) | 隐式(极大) | 隐式但合成可及 |
合成可行性 | 可内嵌 | 需额外约束 | 通常较差 | 内嵌 |
样本效率 | 高(BO引导) | 中等 | 依赖基准 | 中等 |
探索多样性 | 受库限制 | 较好 | 较好 | 受反应模板限制 |
实验验证 | 有成功案例 | 较少 | 极少 | 极少 |
计算成本 | 低–中 | 低–中 | 高 | 高 |
将计算实验设计算法与机器人实验室集成("closing the loop")是加速科学发现的重要范式。文章指出:
Coley et al.(Science 2019)报告了 AI 规划引导的流动化学机器人合成平台,是这一方向的重要里程碑。
现有生成模型(基于 SMILES 或分子图)在立体化学处理上存在根本性局限:
当前计算基准大多使用可计算的启发式指标(如 QED、SA Score、logP、对接分数),而非真实的生物活性。问题在于:
作者呼吁建立新一代基准,需满足:
文章以一段颇具哲学意味的段落收尾:计算流程不应为存在而存在,而应赋能研究者触达否则无法抵达的发现空间。在可以用领域知识缩小问题相关化学空间的情形下,应优先利用专家直觉;人工对候选分子的筛选与判断,在计算预测与物理实验之间始终扮演不可或缺的中间角色。
这篇综述提供了一套清晰、统一的概念框架,将分子发现领域分散的方法论整合进一个连贯的叙事:化学空间的定义与探索,是所有计算分子设计方法的共同底层逻辑。
文章的独特贡献:
主要局限:
对于任何从事 AI 驱动药物/材料发现的研究者而言,这篇文章是值得读的方法论基础文献。