█ 本文译自 Wolfram|Alpha 化学组开发人员 Jason.Biggs 在 Wolfram 社区发表的文章:Interactively query bond information 最近在S
Lewis结构是简单而且经典的概念,但有些结构不能仅被一个Lewis结构有效描述。此时可以画出多个Lewis结构式,表明实际分子是这些Lewis结构的杂合体。描述同一个实际分子的Lewis结构称为共振结构,这种用多个共振结构描述同一个分子的行为称为共振。在我们学习有机化学的过程中,曾经遇到的一个例子就是吡咯的共振结构。
图1: GEM的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。GEM提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。 每个化合物由两个图组成:原子-化学键的图G和化学键-键角的图H。类似于过往的工作,原子-化学键的图G以原子作为图的节点,化学键作为连接原子的边。 而化学键-键角的图H则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。图神经网络包含多轮迭代,而化学键作为每一轮迭代中图G和图H的桥梁进行信息互通。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
图 1: GEM 的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。 GEM 提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。每个化合物由两个图组成:原子-化学键的图 G 和化学键-键角的图 H。 类似于过往的工作,原子-化学键的图 G 以原子作为图的节点,化学键作为连接原子的边。而化学键-键角的图 H 则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM 不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
2025.05.06.652517 代码: https://bitbucket.org/dokhlab/yuel_bond 简介: 论文提出YuelBond多模态图神经网络框架,用于解决生成分子设计中化学键重建的难题 ,创新点在于能在多种复杂场景下准确重建化学键。 该框架基于图神经网络,以原子为节点、化学键为边,通过特定的消息传递机制学习和预测键序。 实验使用GEOM数据集,在三种场景下对模型进行训练和评估:从准确3D原子坐标恢复键序、在有几何扰动的粗新生化合物中重建化学键、对2D拓扑图重新分配键序。
图1: GEM的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。GEM提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。 每个化合物由两个图组成:原子-化学键的图G和化学键-键角的图H。类似于过往的工作,原子-化学键的图G以原子作为图的节点,化学键作为连接原子的边。 而化学键-键角的图H则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。图神经网络包含多轮迭代,而化学键作为每一轮迭代中图G和图H的桥梁进行信息互通。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
简要地说,连接树中的节点表示分子图中的一个化学键或一个环[这些化学键和环已经预先从数据库中筛选出来定义好。 如图S1所示,第三行中矩形框表示连接树中的化学键节点(对应分子图中的一个化学键);圆圈表示连接树中的环节点(对应分子图中的环);红色圆圈为单原子节点,其被三个化学键节点连接,详细的介绍可以参考原始论文] 类型1边又可细分为三种情况:(1)化学键节点连接单原子节点;(2)两个化学键节点相连;(3)化学键节点和环节点相连。图1A上示例了两个化学键节点相连,图1A下示例了化学键节点和环节点相连。
研究人员提出了 DiffGui,一种靶点条件的 E(3)-等变扩散模型,通过引入化学键扩散和性质引导来解决这些问题。原子扩散与化学键扩散的结合能够显式建模两者的相互依赖,从而同时生成原子和键。 消融实验进一步验证了化学键扩散和性质引导模块的重要性。DiffGui 在新药设计与先导化合物优化中均展现出卓越表现,并在实验室实验中获得验证。 它在前向过程中对原子与化学键分别注入噪声,并在反向生成过程中结合分子性质(如结合亲和力、QED、合成可行性、LogP 和极性表面积)进行引导。 该设计既解决了原子与化学键间的一致性问题,也通过性质约束提升了分子的药物样特征。 研究人员提出的 DiffGui 模型通过整合化学键扩散和性质引导,能够同时生成原子与键,并在保证结构合理性的同时,赋予分子期望的药物属性。
该框架包含三个核心部分: 原子特征增强器(AEE):通过对比学习技术,分析目标分子与其组成部分(合成子)的结构异同 反应中心预测器(RCP):结合化学键能量等基础知识,准确识别可能发生反应的化学键位置 本研究的主要发现 通过分析化学键的特征分布(基于美国专利商标局的50K和480K化学反应数据集),研究发现: 能量较高(≥360 kJ/mol)的化学键,包括双键(如碳-碳双键、碳-氧双键、碳-氮双键) 研究还发现,即使是看似简单的化学键能量信息也能显著提升系统性能,因为高能量的化学键往往更容易参与反应。 图 3 为了更深入地理解这一规律,研究人员分析了化学键的特征。如图3所示,他们发现: 高能量的化学键(如三重键、芳香键)通常很稳定,不易参与反应。 图4证实了这一点:当一个化学键连接的两个原子具有相反的电性时,它更可能成为反应发生的位置。
键删除(Bond Deletion)如图1(b)中的黄色方框所示, "键删除"以一定比例随机删除原子之间的化学键。 原子之间化学键的形成和断裂决定了化学反应中分子的属性。键的删除模拟了化学键的断裂,促使模型学习一个分子在各种反应中的关联性。 然后,被屏蔽的原子之间的化学键被删除,这样被屏蔽的原子和被删除的化学键就形成了原分子图的子图。如图1(b)中的蓝色方框所示,被移除的子图包括被遮蔽原子之间的所有化学键。
3D分子生成需要同时处理原子类型、化学键和三维坐标等多模态信息,但现有方法将等变和不变模态分别编码到独立的潜空间,导致模型复杂、效率低下。 这种设计确保了:化学键信息不会在编码过程中丢失,解码时能准确重建分子的键连接。 相比之下,之前的工作往往在重构时丢失部分化学键信息或产生较大的坐标偏差。 3.2 生成质量:键长分布的突破 在分子生成任务中,一个关键的质量指标是键长分布——生成分子的化学键长度应该符合物理规律(如C-C单键约1.54 Å,C=C双键约1.34 Å)。 4.2 信息协同:模态之间的对话 在统一潜空间中,原子类型、化学键和坐标的信息是交织在一起的。编码器在处理一个原子时,可以同时"看到"它的类型、周围的键和空间位置。
Retro-MTGR的工作流程图 研究亮点:从键能到分子电性,AI揭示药物合成的深层规律 这项研究的最大亮点之一,在于通过学习分子化学键的结构,键能等属性,揭示了哪些化学键可能成为反应中心,哪些则可能只是普通的化学键 具体来说: 高键能(>=360 kJ/mol)的化学键,如双键和三键,通常是普通键; 低键能的单键(如C-N、C-O等)可能是反应中心,也可能是普通键,这取决于周围分子的结构; 反应中心的原子通常具有相反的电性 图2.化学键嵌入空间的展示 图3.合成子和离去基的联合嵌入空间展示 实验验证:准确预测药物合成路径 为了验证这一创新框架的有效性,研究团队通过预测两种药物Sonidegib和Acotiamide的逆合成路线
在这篇论文中,研究者表示有向信息传递网络能直接从分子的图结构预测分子的属性,其中原子可以表示为节点,化学键可以表示为边。 在初始化特征向量时,它又分为原子特征向量与化学键特征向量。 如下最左边的神经网络建模,其最上面为一个分子图,第 3 个原子和第 4 个原子都有连向第 2 个原子的化学键(Bond),下面两个黑色的向量表示这两个连接。 以此类推,红色向量表示第 2 个原子连接到第 1 个原子的化学键。 ? 该模型应用了一系列信息传递步骤,它会聚合邻近原子与化学键的信息,从而理解局部分子的化学性质。 在有向信息传递网络的每次信息传递过程中,通过求和邻近化学键特征向量,并馈送到非线性单层神经网络中,化学键特征向量能得到更新。
近年来,Transformer模型凭借全局自注意力机制逐渐应用于分子学习,但如何充分编码原子、化学键、拓扑结构及立体几何信息,仍然是限制模型性能的重要因素。 其中,图神经网络能够直接利用原子和化学键构建分子图,因此成为分子机器学习的重要方向。 原子图以原子作为节点、化学键作为边;键图则通过线图变换,将化学键视为节点,原子连接关系转化为边,从而从另一种角度描述分子拓扑结构。 通过结合注意力权重和梯度信息,模型能够自动识别影响预测结果的重要原子和化学键。在血脑屏障预测任务中,模型重点关注氢键受体和杂环结构,这与经典药物设计规律一致。 相比传统仅依赖原子图的方法,双图表示同时建模原子和化学键,使自注意力能够更加全面地学习局部化学环境和全局拓扑关系,从而显著提升分子性质预测性能。
该技术在国外已有超过35年的商用历史,它可以通过侦测有机物的化学键特征分析其成分,被用在食品行业品质分析、有机物含量非接触监测,在食品、畜牧和防治等行业被广泛应用。 检测原理如下: 在有机物分子中,组成化学键或官能团的原子处于不断振动的状态,其振动频率与红外光的振动频率相当。 所以,用红外光照射有机物分子时,分子中的化学键或官能团可发生震动吸收,不同的化学键或官能团吸收频率不同,在红外光谱上将处于不同位置,从而可获得分子中含有何种化学键或官能团的信息。
首先,团队开发了靶标口袋三维结构感知的骨架修饰模型 DiffDec,让模型“看见口袋”,生成与口袋几何形状互补、化学环境匹配的分子;在此基础上,团队引入化学键约束和蛋白-配体亲和力引导,开发了 Diffleop 针对这些问题,团队在靶标结构感知的基础上进一步引入化学键约束和蛋白-配体亲和力引导,开发了Diffleop模型(图3),使分子生成同时面向“结合得更强”与“结构更合理”两个目标。 Diffleop在全连接分子图上对配体原子坐标、原子类型和化学键类型进行同步扩散,并以“虚拟键”表示原本不存在的连接,使模型能够在统一的去噪过程中学习化学键的分布。 与此同时,团队构建了 E(3) 等变亲和力预测网络,在每一步采样中计算亲和力相对于原子坐标、原子类型和化学键类型的梯度,并利用该梯度引导分子生成朝着亲和力提升的方向进行。 消融实验进一步验证了两项引导信息的互补作用:亲和力引导决定分子向更强结合方向优化,化学键扩散则帮助模型维持结构合理性和类药性。
该方法直接在原子间距离空间中进行生成建模,从而更加自然地描述化学键断裂与形成过程。研究设计了基于最优传输思想的生成路径,并构建双分支神经网络学习反应物到过渡态的连续演化过程。 研究人员认为,距离几何空间更符合化学反应本质,因为化学键形成和断裂本质上表现为原子间距离的改变。因此,他们提出在距离几何空间中构建流匹配生成模型,以实现更加符合化学规律的过渡态预测。 结果 TS-DFM总体框架 当前最先进的过渡态预测模型大多在笛卡尔坐标空间中进行扩散或流匹配生成,但连续生成过程中容易经过不合理结构区域,且难以直接刻画化学键变化过程。 研究进一步分析发现,TS-DFM尤其擅长预测化学键断裂与形成区域的距离变化。在决定反应机理的关键键变化区域,其预测误差明显低于其它模型,表明距离几何表示更符合化学反应本质。 研究认为,距离几何空间中的建模方式更容易学习化学键演化规律,因此具有更强的迁移能力和泛化能力。 图4: TS-DFM在RGD1数据集上的泛化能力评估。
确保分子旋转/平移后输出一致 • 图神经网络(GNN):通过消息传递捕捉原子间相互作用 • 复杂流匹配目标:依赖耦合最优传输等高级数学框架 但这些“祖传”设计并没有解决核心问题——生成的分子仍频繁出现化学键长度异常 TABASCO的叛逆之处在于:它完全抛弃了这些约束,采用非等变Transformer架构,将原子视为序列处理,生成后再用化学工具确定性重建化学键。 无键设计:让Transformer专注于坐标生成 传统模型将化学键作为独立模态处理,导致计算资源分散。 TABASCO反其道而行: • 生成时只预测原子坐标和类型,不建模化学键 • 生成后用RDKit等成熟工具根据坐标自动推断键合关系 • 实验证明:只要坐标足够精确,化学键信息可完全由物理规则推导 这种设计让模型将
首先,团队开发了靶标口袋三维结构感知的骨架修饰模型 DiffDec,让模型“看见口袋”,生成与口袋几何形状互补、化学环境匹配的分子;在此基础上,团队引入化学键约束和蛋白-配体亲和力引导,开发了 Diffleop 针对这些问题,团队在靶标结构感知的基础上进一步引入化学键约束和蛋白-配体亲和力引导,开发了Diffleop模型(图3),使分子生成同时面向“结合得更强”与“结构更合理”两个目标。 Diffleop在全连接分子图上对配体原子坐标、原子类型和化学键类型进行同步扩散,并以“虚拟键”表示原本不存在的连接,使模型能够在统一的去噪过程中学习化学键的分布。 与此同时,团队构建了 E(3) 等变亲和力预测网络,在每一步采样中计算亲和力相对于原子坐标、原子类型和化学键类型的梯度,并利用该梯度引导分子生成朝着亲和力提升的方向进行。 消融实验进一步验证了两项引导信息的互补作用:亲和力引导决定分子向更强结合方向优化,化学键扩散则帮助模型维持结构合理性和类药性。
网络的每一层包含四个模块,它们工作方式如下:(1)对于每一个化学键,利用它两个端点的原子特征去更新该化学键的特征;(2)对于任意原子,利用和它相邻的化学键去更新原子的特征;(3)利用刚刚更新的原子和化学键特征去更新分子的一个整体表达