ArcTan[n1.n2, Cross[n1, Normalize@b2].n2] ]; dihedralFromAtomNumbers[{a1_,a2_,a3_,a4_ }]:=dihedralFromVectors[ (Subtract@@coords[[#]])&/@{{a1,a2},{a2,a3},{a3,a4}} ]; bondLength Degree,""]}, {"dihedral angle", If[Length@Union@pts>3, (dihedralFromAtomNumbers@pts[[;;4] Setting[atoms]] }], {"MouseClicked":> If[ Length@clicked===4,
4. 化学共振分析 化学共振分析的输入文件pyrrole_wfrt.in如下: File = pyrrole-sgp Job = WFRT LMOS = 16 17 18 Atoms = 1 2 3 4 5 ------------ 1 0.670774 0.5606050 148.15 37.81% 40.62% 27.02% 28.52% 35.85% 5: 1-2 3-4 0.2891216 270.26 12.01% 8.55% 7.19% 8.73% 8.50% 3: 1-2 4-5 4 0.378294 0.2639484 7.81% 5.99% 7.98% 8.27% 1: 2-3 4-5 这5个Lewis结构示意图和相应的比例分别为: ?
图1: GEM的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。GEM提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。 每个化合物由两个图组成:原子-化学键的图G和化学键-键角的图H。类似于过往的工作,原子-化学键的图G以原子作为图的节点,化学键作为连接原子的边。 而化学键-键角的图H则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。图神经网络包含多轮迭代,而化学键作为每一轮迭代中图G和图H的桥梁进行信息互通。 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。 paddlehelix.baidu.com/ 合作洽谈: baidubio_cooperate@baidu.com 参考资料 https://www.nature.com/articles/s42256-021-00438-4
图1: GEM的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。GEM提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。 每个化合物由两个图组成:原子-化学键的图G和化学键-键角的图H。类似于过往的工作,原子-化学键的图G以原子作为图的节点,化学键作为连接原子的边。 而化学键-键角的图H则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。图神经网络包含多轮迭代,而化学键作为每一轮迭代中图G和图H的桥梁进行信息互通。 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。 Nat Mach Intell 4, 127–134 (2022). https://doi.org/10.1038/s42256-021-00438-4
论文链接:https://www.nature.com/articles/s42256-021-00438-4 公开资料显示,《Machine Intelligence》是《Nature》旗下专注于机器学习领域的顶级期刊 GEM 提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。每个化合物由两个图组成:原子-化学键的图 G 和化学键-键角的图 H。 类似于过往的工作,原子-化学键的图 G 以原子作为图的节点,化学键作为连接原子的边。而化学键-键角的图 H 则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM 不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
实验结果 研究团队将新开发的 Retro-MTGR 系统与16种最先进的化学反应预测方法进行了比较(4种基于模板的方法、6种无模板的方法以及6种基于半模板的方法)。 研究还发现,即使是看似简单的化学键能量信息也能显著提升系统性能,因为高能量的化学键往往更容易参与反应。 图 4 更有趣的是,研究发现同样类型的化学键在不同分子中可能表现出不同的反应倾向。这就像一个人的性格不仅取决于自身,还受周围环境的影响。 图4证实了这一点:当一个化学键连接的两个原子具有相反的电性时,它更可能成为反应发生的位置。 它先将目标分子(标记为“1”)分成两块(“2”和“3”),然后继续将这些部分分解成更小的片段(“4”到“7”)。这就像提供了一份“倒序”的组装说明书。
研究人员提出了 DiffGui,一种靶点条件的 E(3)-等变扩散模型,通过引入化学键扩散和性质引导来解决这些问题。原子扩散与化学键扩散的结合能够显式建模两者的相互依赖,从而同时生成原子和键。 消融实验进一步验证了化学键扩散和性质引导模块的重要性。DiffGui 在新药设计与先导化合物优化中均展现出卓越表现,并在实验室实验中获得验证。 它在前向过程中对原子与化学键分别注入噪声,并在反向生成过程中结合分子性质(如结合亲和力、QED、合成可行性、LogP 和极性表面积)进行引导。 该设计既解决了原子与化学键间的一致性问题,也通过性质约束提升了分子的药物样特征。 湿实验进一步验证了 DiffGui 的有效性,例如在 RSK4 与 DHODH 等靶点上生成的化合物展现出较强的抑制活性。
简要地说,连接树中的节点表示分子图中的一个化学键或一个环[这些化学键和环已经预先从数据库中筛选出来定义好。 如图S1所示,第三行中矩形框表示连接树中的化学键节点(对应分子图中的一个化学键);圆圈表示连接树中的环节点(对应分子图中的环);红色圆圈为单原子节点,其被三个化学键节点连接,详细的介绍可以参考原始论文] 类型1边又可细分为三种情况:(1)化学键节点连接单原子节点;(2)两个化学键节点相连;(3)化学键节点和环节点相连。图1A上示例了两个化学键节点相连,图1A下示例了化学键节点和环节点相连。 将可逆连接树的隐表示视为状态(state),采取action来修改可逆连接树,并将action定义为以下4个组件(示例见图2B): 选择需要添加新节点的节点(Node) 从预定义节点库中选择一个节点(Word 4 结论 在这项研究中,作者引入了可逆连接树,一种分子的粗粒度表示,可以直接转换为原始化学结构。作者利用这种表示法进行药物发现,将分子设计任务用强化学习形式化为生成一个可逆连接树。
,创新点在于能在多种复杂场景下准确重建化学键。 该框架基于图神经网络,以原子为节点、化学键为边,通过特定的消息传递机制学习和预测键序。 4. 实验使用QM9、OPV、PCQM4Mv2和Molecule3D数据集,训练模型400个epoch,用Adam优化器。 结果显示,在小数据集QM9和OPV上,结合几何信息的模型能显著提升性能;在大规模数据集PCQM4Mv2和Molecule3D上,EquiHGNN也取得了有竞争力的结果。
Retro-MTGR的工作流程图 研究亮点:从键能到分子电性,AI揭示药物合成的深层规律 这项研究的最大亮点之一,在于通过学习分子化学键的结构,键能等属性,揭示了哪些化学键可能成为反应中心,哪些则可能只是普通的化学键 具体来说: 高键能(>=360 kJ/mol)的化学键,如双键和三键,通常是普通键; 低键能的单键(如C-N、C-O等)可能是反应中心,也可能是普通键,这取决于周围分子的结构; 反应中心的原子通常具有相反的电性 图2.化学键嵌入空间的展示 图3.合成子和离去基的联合嵌入空间展示 实验验证:准确预测药物合成路径 为了验证这一创新框架的有效性,研究团队通过预测两种药物Sonidegib和Acotiamide的逆合成路线 图4. 对于两种药物的预测逆合成路线和真实化学合成路线展示 结果表明,Retro-MTGR推断出的合成路线与实际结果高度一致(如图4所示),这无疑证明了其在药物研发中的巨大潜力。
3D分子生成需要同时处理原子类型、化学键和三维坐标等多模态信息,但现有方法将等变和不变模态分别编码到独立的潜空间,导致模型复杂、效率低下。 这种设计确保了:化学键信息不会在编码过程中丢失,解码时能准确重建分子的键连接。 相比之下,之前的工作往往在重构时丢失部分化学键信息或产生较大的坐标偏差。 4. 为什么统一更好 4.1 奥卡姆剃刀:简单即美 统一潜空间的第一个优势是概念简洁。与其维护两套独立的编码-解码系统,不如用一个系统处理所有信息。 Q4:为什么训练能快5倍? 主要原因是单一前向传播路径。分离潜空间需要分别编码和解码等变与不变特征,相当于两次网络前向传播。统一潜空间只需一次。
在这篇论文中,研究者表示有向信息传递网络能直接从分子的图结构预测分子的属性,其中原子可以表示为节点,化学键可以表示为边。 在初始化特征向量时,它又分为原子特征向量与化学键特征向量。 如下最左边的神经网络建模,其最上面为一个分子图,第 3 个原子和第 4 个原子都有连向第 2 个原子的化学键(Bond),下面两个黑色的向量表示这两个连接。 以此类推,红色向量表示第 2 个原子连接到第 1 个原子的化学键。 ? 该模型应用了一系列信息传递步骤,它会聚合邻近原子与化学键的信息,从而理解局部分子的化学性质。 在有向信息传递网络的每次信息传递过程中,通过求和邻近化学键特征向量,并馈送到非线性单层神经网络中,化学键特征向量能得到更新。
近年来,Transformer模型凭借全局自注意力机制逐渐应用于分子学习,但如何充分编码原子、化学键、拓扑结构及立体几何信息,仍然是限制模型性能的重要因素。 其中,图神经网络能够直接利用原子和化学键构建分子图,因此成为分子机器学习的重要方向。 原子图以原子作为节点、化学键作为边;键图则通过线图变换,将化学键视为节点,原子连接关系转化为边,从而从另一种角度描述分子拓扑结构。 图4: 基于注意力机制的关键分子结构解释结果。 讨论 研究人员提出的Dual Graph Transformer为Transformer分子学习提供了一种新的表示范式。 相比传统仅依赖原子图的方法,双图表示同时建模原子和化学键,使自注意力能够更加全面地学习局部化学环境和全局拓扑关系,从而显著提升分子性质预测性能。
然而,随着AIforScience(AI4S)的崛起,这一局面正在发生根本性的逆转。 NodeFeatures)foriinrange(num_atoms):G.add_node(i,element=atom_types[i],coord=coordinates[i])#2.空间距离矩阵计算与边(化学键 coordinates[i]coord_j=coordinates[j]#计算欧氏距离distance=np.linalg.norm(coord_i-coord_j)#若小于截断半径,则认为存在相互作用(化学键 总原子数(节点):{mol_graph.number_of_nodes()}")print(f"检测到的化学键数(总边数):{mol_graph.number_of_edges()}")print("\ node[0]}:元素={node[1]['element']},空间坐标={node[1]['coord']}")foredgeinmol_graph.edges(data=True):print(f"化学键
网络的每一层包含四个模块,它们工作方式如下:(1)对于每一个化学键,利用它两个端点的原子特征去更新该化学键的特征;(2)对于任意原子,利用和它相邻的化学键去更新原子的特征;(3)利用刚刚更新的原子和化学键特征去更新分子的一个整体表达 (4)根据每个原子特征,预测它的坐标。 作者在PCQM4M-v2的数据集上进行预训练,训练预料约3.38M个 2D/3D数据对。预训练的网络结构和DMCG网络结构保持一致。 图四:损失函数流程图。
针对这些问题,团队在靶标结构感知的基础上进一步引入化学键约束和蛋白-配体亲和力引导,开发了Diffleop模型(图3),使分子生成同时面向“结合得更强”与“结构更合理”两个目标。 Diffleop在全连接分子图上对配体原子坐标、原子类型和化学键类型进行同步扩散,并以“虚拟键”表示原本不存在的连接,使模型能够在统一的去噪过程中学习化学键的分布。 与此同时,团队构建了 E(3) 等变亲和力预测网络,在每一步采样中计算亲和力相对于原子坐标、原子类型和化学键类型的梯度,并利用该梯度引导分子生成朝着亲和力提升的方向进行。 消融实验进一步验证了两项引导信息的互补作用:亲和力引导决定分子向更强结合方向优化,化学键扩散则帮助模型维持结构合理性和类药性。 图4. 保守位点与相互作用引导的DiffDeCIG模型框架。
键删除(Bond Deletion)如图1(b)中的黄色方框所示, "键删除"以一定比例随机删除原子之间的化学键。 原子之间化学键的形成和断裂决定了化学反应中分子的属性。键的删除模拟了化学键的断裂,促使模型学习一个分子在各种反应中的关联性。 然后,被屏蔽的原子之间的化学键被删除,这样被屏蔽的原子和被删除的化学键就形成了原分子图的子图。如图1(b)中的蓝色方框所示,被移除的子图包括被遮蔽原子之间的所有化学键。
em.log:ASCll文本的日志文件,记录了能量最小化过程em.edr:二进制能量文件em.trr:全精度的二进制轨迹文件em.gro:能量最小化后的结构我们来运行一下gmx mdrun -ntmpi 4 编号名称物理含义备注1Bond键长伸缩能原子间化学键被拉伸或压缩产生的能量。2Angle键角弯折能 三个原子形成的化学键角度变化产生的能量。 3Proper-Dih.正常二面角能沿化学键旋转四个原子时,由特定二面角产生的能量。4Ryckaert-Bell.RB二面角能一种特殊的二面角函数形式,常用于烷烃链。 5LJ-141-4相互作用LJ能相隔三个化学键的原子对之间,范德华作用能量。6Coulomb-141-4相互作用静电能相隔三个化学键的原子对之间,静电作用能量。
该方法直接在原子间距离空间中进行生成建模,从而更加自然地描述化学键断裂与形成过程。研究设计了基于最优传输思想的生成路径,并构建双分支神经网络学习反应物到过渡态的连续演化过程。 研究人员认为,距离几何空间更符合化学反应本质,因为化学键形成和断裂本质上表现为原子间距离的改变。因此,他们提出在距离几何空间中构建流匹配生成模型,以实现更加符合化学规律的过渡态预测。 结果 TS-DFM总体框架 当前最先进的过渡态预测模型大多在笛卡尔坐标空间中进行扩散或流匹配生成,但连续生成过程中容易经过不合理结构区域,且难以直接刻画化学键变化过程。 研究进一步分析发现,TS-DFM尤其擅长预测化学键断裂与形成区域的距离变化。在决定反应机理的关键键变化区域,其预测误差明显低于其它模型,表明距离几何表示更符合化学反应本质。 研究认为,距离几何空间中的建模方式更容易学习化学键演化规律,因此具有更强的迁移能力和泛化能力。 图4: TS-DFM在RGD1数据集上的泛化能力评估。
针对这些问题,团队在靶标结构感知的基础上进一步引入化学键约束和蛋白-配体亲和力引导,开发了Diffleop模型(图3),使分子生成同时面向“结合得更强”与“结构更合理”两个目标。 Diffleop在全连接分子图上对配体原子坐标、原子类型和化学键类型进行同步扩散,并以“虚拟键”表示原本不存在的连接,使模型能够在统一的去噪过程中学习化学键的分布。 与此同时,团队构建了 E(3) 等变亲和力预测网络,在每一步采样中计算亲和力相对于原子坐标、原子类型和化学键类型的梯度,并利用该梯度引导分子生成朝着亲和力提升的方向进行。 消融实验进一步验证了两项引导信息的互补作用:亲和力引导决定分子向更强结合方向优化,化学键扩散则帮助模型维持结构合理性和类药性。 图4. 保守位点与相互作用引导的DiffDeCIG模型框架。