我们使用 EventHandler 和 MousePosition["Graphics3DBoxIntercepts"] 使鼠标点击与原子选择关联。 bondLength, bondAngle, findAtomNearestToLine, bondInfoBox}, dihedralFromVectors[{b1_, b2_, b3_ ; ArcTan[n1.n2, Cross[n1, Normalize@b2].n2] ]; dihedralFromAtomNumbers[{a1_,a2_,a3_,a4 _}]:=dihedralFromVectors[ (Subtract@@coords[[#]])&/@{{a1,a2},{a2,a3},{a3,a4}} ]; bondLength ])/Degree,""]}, {"dihedral angle", If[Length@Union@pts>3, (dihedralFromAtomNumbers@
若是要按上面的Lewis结构成键,N原子会是sp3杂化,因此吡咯分子就是非平面的。然而实际上吡咯分子却是平面结构。为了解释这一实验结果,我们可以用EzReson对吡咯做化学共振分析。 为了得到合理的结构,需要首先用Gaussian对吡咯做几何结构优化,输入文件如下所示: %chk=pyrrole-opt.chk %nprocshared=1 %mem=1GB #p opt freq b3lyp 4 2 0.413061 0.2891228 270.26 12.01% 8.55% 7.19% 8.73% 8.50% 2: 3-4 1-5 3 0.413060 7.81% 5.99% 7.98% 8.27% 1: 2-3 4-5 这5个Lewis结构示意图和相应的比例分别为: ? 在前面的局域轨道图中,我们也可以看出,N原子的孤对电子(LMO-16)在p轨道上,而不是在sp3杂化轨道上。这也说明了吡咯中的N原子不是sp3杂化,而是sp2杂化。
图1: GEM的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。GEM提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。 每个化合物由两个图组成:原子-化学键的图G和化学键-键角的图H。类似于过往的工作,原子-化学键的图G以原子作为图的节点,化学键作为连接原子的边。 而化学键-键角的图H则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。图神经网络包含多轮迭代,而化学键作为每一轮迭代中图G和图H的桥梁进行信息互通。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
图1: GEM的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。GEM提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。 每个化合物由两个图组成:原子-化学键的图G和化学键-键角的图H。类似于过往的工作,原子-化学键的图G以原子作为图的节点,化学键作为连接原子的边。 而化学键-键角的图H则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。图神经网络包含多轮迭代,而化学键作为每一轮迭代中图G和图H的桥梁进行信息互通。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
简要地说,连接树中的节点表示分子图中的一个化学键或一个环[这些化学键和环已经预先从数据库中筛选出来定义好。 如图S1所示,第三行中矩形框表示连接树中的化学键节点(对应分子图中的一个化学键);圆圈表示连接树中的环节点(对应分子图中的环);红色圆圈为单原子节点,其被三个化学键节点连接,详细的介绍可以参考原始论文] 类型1边又可细分为三种情况:(1)化学键节点连接单原子节点;(2)两个化学键节点相连;(3)化学键节点和环节点相连。图1A上示例了两个化学键节点相连,图1A下示例了化学键节点和环节点相连。 两个节点公共原子是0号位的两个C和3号位的两个C。 例如,考虑到涉及对接模拟的3D生成,RJT-RL模型的有效训练需要正确处理生成化合物的立体异构体。本研究中枚举了可能的立体异构体,并使用暴力法寻找最佳立体异构体。
图 1: GEM 的整体框架 基于空间结构的图神经网络 由于化合物的集合结构可以完全被原子-化学键键长-键角确定。 GEM 提出了一种基于空间结构的图网络,同时对原子-化学键-键角的关系建模空间结构信息。每个化合物由两个图组成:原子-化学键的图 G 和化学键-键角的图 H。 类似于过往的工作,原子-化学键的图 G 以原子作为图的节点,化学键作为连接原子的边。而化学键-键角的图 H 则为首次引入,以化学键作为图的节点,两个化学键所形成的键角为图的边。 基于空间结构的自监督学习 为了使模型更好学习到化学空间知识,GEM 不单单只是将几何信息作为输入,更进一步地设计了基于几何信息的学习任务(目标):预测化学键的长度;预测化学键组成的键角;预测两两原子之间的距离 描述局部结构的自监督学习任务随机挑选化合物中以某个原子为中心的子图并进行遮盖,预测被遮盖的子图中的化学键的键长和化学键间形成的键角。描述全局结构的自监督学习任务则预估原子距离矩阵中的元素。
研究人员提出了 DiffGui,一种靶点条件的 E(3)-等变扩散模型,通过引入化学键扩散和性质引导来解决这些问题。原子扩散与化学键扩散的结合能够显式建模两者的相互依赖,从而同时生成原子和键。 消融实验进一步验证了化学键扩散和性质引导模块的重要性。DiffGui 在新药设计与先导化合物优化中均展现出卓越表现,并在实验室实验中获得验证。 它在前向过程中对原子与化学键分别注入噪声,并在反向生成过程中结合分子性质(如结合亲和力、QED、合成可行性、LogP 和极性表面积)进行引导。 该设计既解决了原子与化学键间的一致性问题,也通过性质约束提升了分子的药物样特征。 Target-aware 3D molecular generation based on guided equivariant diffusion.
结果表明,在没有反应类型提示的情况下,Retro-MTGR 能以54.3%的准确率预测出正确的反应路径,如果给出3次预测机会,准确率可提升至76.7%,给出5次机会则可达到90.1%。 研究还发现,即使是看似简单的化学键能量信息也能显著提升系统性能,因为高能量的化学键往往更容易参与反应。 图 3 为了更深入地理解这一规律,研究人员分析了化学键的特征。如图3所示,他们发现: 高能量的化学键(如三重键、芳香键)通常很稳定,不易参与反应。 为了便于理解,他们使用了一种叫做PCA的数学工具,将复杂的高维数据转换成可以在3D空间中展示的图像(图5)。 它先将目标分子(标记为“1”)分成两块(“2”和“3”),然后继续将这些部分分解成更小的片段(“4”到“7”)。这就像提供了一份“倒序”的组装说明书。
3D分子生成需要同时处理原子类型、化学键和三维坐标等多模态信息,但现有方法将等变和不变模态分别编码到独立的潜空间,导致模型复杂、效率低下。 通过让神经网络"学习"而非"内置"等变性,UAE-3D 实现了近乎无损的重构(原子和化学键准确率均为100%,坐标误差仅0.0002 Å),训练速度比现有方法快5.3倍,采样速度快7.3倍,键长分布误差降低 多模态困境:为什么需要统一 1.1 分子的多重面孔 一个3D分子包含三类关键信息: 原子类型:碳、氮、氧等元素,决定化学性质 化学键:单键、双键、三键,决定分子稳定性 3D坐标:原子的空间位置,决定分子形状和生物活性 : 原子类型准确率:100% 化学键准确率:100% 坐标均方根偏差:0.0002 Å(相当于原子半径的1/5000) 这一结果表明:UAE-3D 的压缩几乎是信息无损的。 Q3:键长误差降低25倍的物理意义是什么? 化学键长是分子能量的关键决定因素。偏离理想键长会导致应力和不稳定。
2025.05.06.652517 代码: https://bitbucket.org/dokhlab/yuel_bond 简介: 论文提出YuelBond多模态图神经网络框架,用于解决生成分子设计中化学键重建的难题 ,创新点在于能在多种复杂场景下准确重建化学键。 该框架基于图神经网络,以原子为节点、化学键为边,通过特定的消息传递机制学习和预测键序。 实验使用GEOM数据集,在三种场景下对模型进行训练和评估:从准确3D原子坐标恢复键序、在有几何扰动的粗新生化合物中重建化学键、对2D拓扑图重新分配键序。 3.
Retro-MTGR的工作流程图 研究亮点:从键能到分子电性,AI揭示药物合成的深层规律 这项研究的最大亮点之一,在于通过学习分子化学键的结构,键能等属性,揭示了哪些化学键可能成为反应中心,哪些则可能只是普通的化学键 具体来说: 高键能(>=360 kJ/mol)的化学键,如双键和三键,通常是普通键; 低键能的单键(如C-N、C-O等)可能是反应中心,也可能是普通键,这取决于周围分子的结构; 反应中心的原子通常具有相反的电性 不仅如此,Retro-MTGR还通过联合嵌入空间分析了合成子和离去基的电性分布,揭示了反应过程中的关键规律(如图3所示),这包括:反应中的两个合成子总是具有相反的电性并且彼此相距甚远;属于同一个反应物的合成子和离去基通常具有相反的电性并且彼此靠近 图2.化学键嵌入空间的展示 图3.合成子和离去基的联合嵌入空间展示 实验验证:准确预测药物合成路径 为了验证这一创新框架的有效性,研究团队通过预测两种药物Sonidegib和Acotiamide的逆合成路线
在初始化特征向量时,它又分为原子特征向量与化学键特征向量。 如下最左边的神经网络建模,其最上面为一个分子图,第 3 个原子和第 4 个原子都有连向第 2 个原子的化学键(Bond),下面两个黑色的向量表示这两个连接。 以此类推,红色向量表示第 2 个原子连接到第 1 个原子的化学键。 ? 该模型应用了一系列信息传递步骤,它会聚合邻近原子与化学键的信息,从而理解局部分子的化学性质。 在有向信息传递网络的每次信息传递过程中,通过求和邻近化学键特征向量,并馈送到非线性单层神经网络中,化学键特征向量能得到更新。 参考内容: https://www.nature.com/articles/d41586-020-00018-3 http://news.mit.edu/2020/artificial-intelligence-identifies-new-antibiotic
近年来,Transformer模型凭借全局自注意力机制逐渐应用于分子学习,但如何充分编码原子、化学键、拓扑结构及立体几何信息,仍然是限制模型性能的重要因素。 其中,图神经网络能够直接利用原子和化学键构建分子图,因此成为分子机器学习的重要方向。 原子图以原子作为节点、化学键作为边;键图则通过线图变换,将化学键视为节点,原子连接关系转化为边,从而从另一种角度描述分子拓扑结构。 结果显示,仅保留原子图或仅保留键图都会导致预测性能下降,其中移除键图后预测误差增加约3%,移除原子图后误差增加约6%,说明两种表示方式能够互补提供不同层面的化学信息。 图3: 双图表示、三维信息及立体化学信息对模型性能的贡献分析。 图4: 基于注意力机制的关键分子结构解释结果。
针对这些问题,团队在靶标结构感知的基础上进一步引入化学键约束和蛋白-配体亲和力引导,开发了Diffleop模型(图3),使分子生成同时面向“结合得更强”与“结构更合理”两个目标。 Diffleop在全连接分子图上对配体原子坐标、原子类型和化学键类型进行同步扩散,并以“虚拟键”表示原本不存在的连接,使模型能够在统一的去噪过程中学习化学键的分布。 与此同时,团队构建了 E(3) 等变亲和力预测网络,在每一步采样中计算亲和力相对于原子坐标、原子类型和化学键类型的梯度,并利用该梯度引导分子生成朝着亲和力提升的方向进行。 消融实验进一步验证了两项引导信息的互补作用:亲和力引导决定分子向更强结合方向优化,化学键扩散则帮助模型维持结构合理性和类药性。 图3. 亲和力驱动的Diffleop模型框架。
针对这些问题,团队在靶标结构感知的基础上进一步引入化学键约束和蛋白-配体亲和力引导,开发了Diffleop模型(图3),使分子生成同时面向“结合得更强”与“结构更合理”两个目标。 Diffleop在全连接分子图上对配体原子坐标、原子类型和化学键类型进行同步扩散,并以“虚拟键”表示原本不存在的连接,使模型能够在统一的去噪过程中学习化学键的分布。 与此同时,团队构建了 E(3) 等变亲和力预测网络,在每一步采样中计算亲和力相对于原子坐标、原子类型和化学键类型的梯度,并利用该梯度引导分子生成朝着亲和力提升的方向进行。 消融实验进一步验证了两项引导信息的互补作用:亲和力引导决定分子向更强结合方向优化,化学键扩散则帮助模型维持结构合理性和类药性。 图3. 亲和力驱动的Diffleop模型框架。
3D分子构象生成指的是给定2D分子图,生成对应的稳定3D分子构象,即生成每一个原子的坐标。相对于传统的基于实验或者数值计算的方法,基于机器学习的方法具有计算速度快、计算效果好的优势。 网络的每一层包含四个模块,它们工作方式如下:(1)对于每一个化学键,利用它两个端点的原子特征去更新该化学键的特征;(2)对于任意原子,利用和它相邻的化学键去更新原子的特征;(3)利用刚刚更新的原子和化学键特征去更新分子的一个整体表达 拓展:2D & 3D 联合预训练 DMCG侧重于从2D分子图生成3D构象。基于DMCG的模型架构和训练方案,作者提出基于2D & 3D的联合预训练。该工作发表于KDD2022。 图四(b)展示的是给定2D分子图,重构它的3D构象。这部分采用的是DMCG的方案。图四(c)展示的是给定3D构象,恢复原子类型的属性。 在2D分子图到3D构象生成的任务上,作者和未经过预训练的版本进行了对比。经过预训练后,在3D构象生成的任务上也取得了显著提升。 表3:分子构象生成任务。
过去的3D分子生成模型普遍遵循三大设计原则: • SE(3)等变对称性:确保分子旋转/平移后输出一致 • 图神经网络(GNN):通过消息传递捕捉原子间相互作用 • 复杂流匹配目标:依赖耦合最优传输等高级数学框架 但这些“祖传”设计并没有解决核心问题——生成的分子仍频繁出现化学键长度异常、空间位阻冲突等物理不合理性。 3. 无键设计:让Transformer专注于坐标生成 传统模型将化学键作为独立模态处理,导致计算资源分散。 TABASCO反其道而行: • 生成时只预测原子坐标和类型,不建模化学键 • 生成后用RDKit等成熟工具根据坐标自动推断键合关系 • 实验证明:只要坐标足够精确,化学键信息可完全由物理规则推导 这种设计让模型将
键删除(Bond Deletion)如图1(b)中的黄色方框所示, "键删除"以一定比例随机删除原子之间的化学键。 原子之间化学键的形成和断裂决定了化学反应中分子的属性。键的删除模拟了化学键的断裂,促使模型学习一个分子在各种反应中的关联性。 然后,被屏蔽的原子之间的化学键被删除,这样被屏蔽的原子和被删除的化学键就形成了原分子图的子图。如图1(b)中的蓝色方框所示,被移除的子图包括被遮蔽原子之间的所有化学键。
该方法直接在原子间距离空间中进行生成建模,从而更加自然地描述化学键断裂与形成过程。研究设计了基于最优传输思想的生成路径,并构建双分支神经网络学习反应物到过渡态的连续演化过程。 结果 TS-DFM总体框架 当前最先进的过渡态预测模型大多在笛卡尔坐标空间中进行扩散或流匹配生成,但连续生成过程中容易经过不合理结构区域,且难以直接刻画化学键变化过程。 研究进一步分析发现,TS-DFM尤其擅长预测化学键断裂与形成区域的距离变化。在决定反应机理的关键键变化区域,其预测误差明显低于其它模型,表明距离几何表示更符合化学反应本质。 图3: 利用TS-DFM发现替代反应路径。 未见反应上的泛化能力 为了验证模型泛化能力,研究进一步在RGD1数据集上进行测试。 研究认为,距离几何空间中的建模方式更容易学习化学键演化规律,因此具有更强的迁移能力和泛化能力。 图4: TS-DFM在RGD1数据集上的泛化能力评估。
3.算力与软件基础设施AI4S的爆发离不开算力的指数级增长。NVIDIAH100/H200等顶尖GPU让GNN的训练速度飙升了10-100倍。 战果:科研团队利用扩散模型和强化学习,成功设计出一款Cu3Pd1Cu_3Pd_1Cu3Pd1合金电催化剂,其乙烯法拉第效率(FE)高达82%,比传统催化剂提升了40%,且连续稳定运行超过100小时。 coordinates[i]coord_j=coordinates[j]#计算欧氏距离distance=np.linalg.norm(coord_i-coord_j)#若小于截断半径,则认为存在相互作用(化学键 总原子数(节点):{mol_graph.number_of_nodes()}")print(f"检测到的化学键数(总边数):{mol_graph.number_of_edges()}")print("\ [{edge[0]}-{edge[1]}]:键长={edge[2]['distance']:.3f}Å")