00:01
好。接下来我们的第,嗯,好。接下来上我们的第9课啊,关于这个虚拟筛选的一个部分。前面做这个分子对接呢。嗯,都是给了大家一个蛋白质,然后给了大家一个复合物,让大家自己做一下对接,这种情况呢,一般啊,在教学的过程中啊,是让大家熟悉一下分值对接的这个过程。那实际情况是什么样的?实际情况是啊,给到大家这个蛋白质文件分子结构其实是不知道的。就是大家需要在一个海量的,嗯,这个化合物的这个。啊,数据库里面先找到一些先导化合物。就是找到一些可能和蛋白有结合的,有活性的这样一种化合物啊,找到这些先导化合物之后呢,再进行慢慢改造。啊,最后呢,改造成我们类似于分子对接的那种化合物啊,形成稳定的构象那种化合物啊,这是一个正常的逻辑,很难啊,很难从这个。
01:11
嗯,啊,这个分析的过程中啊,一眼就能找到什么。一个蛋白活性位点它,嗯,给一个怎样的化合物就能够稳定结合,这个是很难一开始就能找到的。当然了,现在有一个学科就是找这个蛋白结构啊,发现它的一个活性位点之后呢,根据它活性位点的一个三维结构。嗯,比如说三维结构有哪些氨基酸残基啊,残疾的特点是什么?它是带正电还是负电啊,电荷性质。容易和哪些这个化学,呃,化学集团形成相互作用力。嗯。等等等等,依据这些特性呢,可以自主设置设计。自己设计一些啊独特的分子和它稳定结合,当然这种学科啊比较难啊,需要大家有庞大的数据积累,以及对蛋白结构有一个非常详细的认知。
02:09
啊,才可以啊才可以,就像前面提到的,当大家把一个新的蛋白质结构解析出来,把它的活性中心啦,各个位置啊都解析出来之后,本身就是一篇好的文章。如果再在这个基础上呢,能够自主设计一些分子,能够稳定的结合这个蛋白,或者对这个蛋白产生一定变化的一些分子啊,大家对这个基础理论啊。研究里已经非常通透了,非常通透。首先我们来到虚拟筛选。啊,虚拟筛选呢,就是从计算机从大量候选的化合物中。通常这个化合物候选化合物从哪儿来的?啊,如果大家,呃,就是课题组,或者说像我一样,就是这个。啊,做研究做课题的时候,候选化合物绝大部分都是从数据库来的。
03:00
那么如果大家是在药企,在公司。啊,公司内部会对候选的化合物就是各个呃,化学化合物呢进行分类。哎,哪些是带正电,哪些带负电,哪些抑与什么结合等等等等,会进行详详细细的分类。通过公司的这种数据库做这个虚拟筛选呢,它的目的性更强一点啊,目的性更强一点,你像我们如果没有没有这样的这个先先验知识。就是从那个数据库下一些啊,下一些化合物进行分组对接,这样的话会比较浪费时间,因为绝大部分化合物啊,可能和我们的目标相去甚远。举一个例子啊,举一个简单的例子,比如说我们知道一个蛋白的内部有某些氨基酸,它容易和比如说和苯环形成相互作用,和羟基型的相互作用,和羧基型的相互作用,对吧,我们在知道了它的一些呃形成的这个特性之后呢,如果是公司的话,公司先把这些筛选条件给提取出来。
04:01
啊,这个分子,这个分子呢,要包含羟基,要包含羧基,包含苯环包环这个等等等等一些关键的特征给它筛选进去。从而从庞大的化合物中先过滤了一遍。然后从剩下的这些化合物中做蛋白分子的一个对接,这样的话会效率高很多啊,高很多。但是呢,这种一般都是在公司层面才会做,而且是大公司啊,小公司他也做不了,大公司才可以。嗯,像我们普通人很难接触到啊,其实将来大家去了这个公司。去了这个在公司层面工作的话,也只是能调用,而不能下载内部数据库啊,数据安全非常重要啊,非常重要。然后呢,从大量的候选化合物中提前筛选出最有可能的与目标蛋白结合具有生物活性的少量分子。再交给实验验证。这个呢,一般都是硕士课题。深化的硕士课题。
05:02
做了对接之后呢,啊,通过分析发现一些化合物具有这个怎么。可能具有活性啊,可能候选了10~20个,然后这10~20个呢,再一个一个实验合成一下去生物学验证,最后找见他们最佳的那个。然后呢?啊,通过实验的方法验证出来之后呢,本身就可以作为。几页啊,就是实验,呃,研究生课题。当然实验有很多很多的指标,像IC50啊等等的,通过实验的测试,看这个化合物到底效果怎么样。其实,虚拟筛选化合物,本质上就是一个大规模化化合物,小规模选药物的计算筛选过程。现在的这个基于这个分子对接的药物设计啊,核心目标也是为了提高化合物在排名前列的负极程度。单纯的测每一个分子的真实结合,结合亲和力啊,只是一种表象,我们要找到一些更结合更加好的分子啊,要从庞大的分子库里面筛选。
06:03
当然了,它筛选出来的分子还离那个。我们想要的目标还很远。前面给大家提到过,如果筛选到有活性的生物分子啊,还要进行什么?分子改造啊。官能团的一个改造,给它,把它的官能团换一换,结构给它换一换,然后在不停的改造中呢,找到一个结合力更强的一个分子啊,这是后面的内容,整个的一个筛选过程啊,其实是非常复杂的啊,非常复杂。嗯,一般需要借助一些,嗯,比如说公司的力量。或者一些什么好的课题组的旅游。像中科院的生化科技组啊,啊,具备这个实力啊,具备这个实力,不过现在那个生化科技组现在更倾向于那个。设计抗体分子。大家知道化合物有个什么缺点吗?化合物一般都要生物合成,生物合成啊,百分之百生成产物,这是不可能的,肯定有一些副产物,还有一些有毒。
07:04
化工车间呢,大家可以看看静毛基本上都穿的那些无尘服啊,等等等等啊,毒性比较高。这种呢,其实对人的这个影响比较大,所以现在更多啊,更倾向于安全的这个蛋白制剂,也就是抗体分子。嗯,不过呢,这个化合物啊,仍然具有它无法取代的作用,大家吃的那个药啊,绝大部分都是化合物。啊,绝大部分都是化合物,就是通过这种一开始层层筛选,最后临床试验拿到的。这个呢是整个的流程,大家可以看一下。啊,靶向选择啊,虚拟药物这个工作流程。靶向选择这个结构准备和优化,结构准备和优化呢,这个指的就是那个蛋白和配体,我们要准备好他们的结构,以及前面提到的。啊,该柔性的地方要柔性,该刚性的地方要刚性,而不是纯刚性对接。所以在真正的虚拟筛选过程中啊,如果有条件的话,尽量采用。
08:02
柔性对接啊,使它的构想更加的准确。啊,如果是半柔性的话,蛋白刚性的话,它虽然速度会加快,但可能会漏掉一些有活性的分子。啊,纯钢性的是啊,现在不被采用,不太符合诱导契合理论。然后呢,预测结合位点。啊,这个地方呢,有一个盲对接。忙对接是什么意思呢?盲对接,就是说我们在这个对接的过程中啊,并不知道哪些位点会发生化合作用。并不知道哪些微量会发挥作用。前面给大家介绍那个柔性堆积的时候,比如说41位组氨酸和145的半胱氨酸。可能会发挥化学作用,所以说呢,把它设置成柔性,那么在实际的这个盲筛选的过程,我们只知道蛋白结构,不知道化合物分子长什么样。啊,蛋白活性口袋呢?当然也有一些研究,知道哪些氨基酸可能离的化合物很近。
09:03
但这都是一种推测。那么在忙的这个,为了加快这个速度呢,就会产生一种盲筛选的一个。啊,就是说。嗯,对接的时候。啊,如果说采用半柔性对接。啊,它就是纯刚性,如果说是这个采用柔性对接呢。就是把那些临近的啊,可能和化合物的氨基酸全部设置成柔性。啊,这样的话进行盲对接,盲对接,然后把有可能有可能有活性的分子啊都给它筛选出来,然后进行。多轮的这个分子对接啊,多轮的分子对接。最后呢,对接的参数要设置好,然后呢,受体呢是受体和。这个蛋白配体要柔性啊,要柔性,然后进行一定的实验验证打分,最后看见它的结合能等等等等啊,筛选出最佳的配体啊,结合模式以及分数,最后呢,得到一个相对可靠的实验的化合物啊,相对可靠的实验化合。
10:07
整个过程会非常的复杂啊,整个过程会非常的复杂,大家实际操作下来的话,这个过程比较耗时间。啊,比较耗时间,算法部分还好啊,可能找到了10~20个,实验部分验证是最麻烦的。首先要啊,一般要能合成啊,筛选到的大部分化合物。啊,几乎什么。很难能买到,就是说你筛选的化合物是那种结构,可能有类似相近的结构在卖,但是你呢,聚这个准准的结构的话,其实很难买到,需要单独合成。单独合成就需要化工企业啊帮助大家合成,整个过程是非常的耗时间,以及辅导啊辅导。啊,这是整个的一个流程,大家可以看一下啊,受体受体结构准备,配体结构准备啊配体呢要进行一些啊实验预测,包括ADMT预测。
11:02
啊,相似性预测啊,积极学习等等等等,就是在所有的化合物之前先预筛一遍。对于公司来讲,不可能把所有的化合物都进行对接,而是要先把它的特征给它塞一遍,就和刚才提到的那样。蛋白活性口袋有一些关键性的残疾,可能与其他的一些残疾会发生相互作用,比如说需要羟基,需要羧基,需要苯环,需要。嗯,苯胺等等的一些结构,那么这些结构呢,先输入到这个化合物中。啊,具有这些结构的话,和我挑出来。啊,进行大规模的批量筛选,而不是直接盲目的把所有的分子都给它丢进去。其中这个admt预测啊。等到我们下节课啊,简单的这个做完啊,虚拟筛选之后也要进行ADMT预测。就是说这个化合物啊。我们不能说实验过程好,就认为它可以。啊,也要进行一些其他指标的验证,比如说这个化合物是不是脂溶性的。
12:04
啊,从这个对接角对接的角度来看啊,他们对接的很好,那是不是我们可以吸收呢。它能不能透过这个胃酸呢?等等等等,这些我们体内的环境都是我们考核的一个指标啊。啊,相似性调查就是说看看这些具有活性的分子都有哪些什么。相同的集团啊,这些集团是不是必要的,还是说哪些改了之后活性会更高呢?啊,机器学习的话,大家啊,现在呢,越引用的越来越多了啊,无论是分子对接分子动力学,还是这个单细胞空间。机器学习引用的都费越来越多了,尤其是现在是AI的时代。AI呢,虽然可以可以帮助我们解决很多的一些问题,但实际的一些交叉学科的问题啊,还需要我们人来做。比如说我们把一些数据给到AIAI帮我们解读生物学内容,大家这个结果啊,肯定是不敢用。
13:01
啊,举个简单的例子,比如说给到了一些啊,某个群的差异基因。啊,给到AI让我们定义,让他定义一下定义的结果,大家敢用吗?啊,放心啊,只要你在这个文章中说,这个细胞定义的结果是AI辅助定义的。审稿人一定会质疑你的问题,就是AI辅助定义你的用的这个数据库哪来的?怎么训练的啊,等等等等各种庞大的问题啊。目前来讲,这方面AI做的还不够完善啊,不够完善。那么来到这个分子对接来讲,AI也会对分子结构进行一定的学习,看这个分子结构都有哪些相同的官能团,相同的集团,哪些是可变的,哪些不可变等等等等,进行相关的学习,最后给到我们一个啊框架。啊,这是这部分是刚性那部分可以柔性可以变啊,但是它只是给到大家一个框架,真正是不是这样。需要大家实验验证一下啊,验证一下不,不能说这个计算的结果就是真的。
14:08
呃,虚拟筛选呢。不等于分子对接啊,分子对接的话,其实就是简单的一个蛋白,一个配体或者几个配给大家自己对接一下。啊,前提是什么。啊,蛋白和配体给到大家对吧,虚拟筛选呢,并不是说简单的分支对接,虚拟筛选呢,其实就是刚才提到的化合物是未知的。啊,这才符合我们真实的一个情况,我们知道蛋白结构,如果一下就能想到是哪个分子在对接,那说明之前已经有人完全验证过了,已经发现了。大多数情况就是得到这个蛋白质结构的时候,我们并不知道哪个化合物能真正的结合,尤其是在这种诱导气候模型下,内部的结构可能会变不性,口袋可能一开始很大,结合之后变小了。啊,等等等等,这些构象的变化,我们一开始是不可能说知道哪个分子能准组的对接的啊,虚拟筛选呢,就是在解决这个问题啊,先找一些诱先导化合物。
15:06
分子对接是虚拟筛选一个重要的计算模块,而虚拟筛选是一套完整的啊候选发合物的发现策略,发现策略本质上来讲啊,本质上来讲。虚拟对接最核心的地方就是批量化的分子对接啊,批量化的分子对接,把所有的分子都对接一遍,找一些,找到其中结合最好啊。啊,最有可能具有这个生物具有活性的分子。嗯,现在基于这个虚拟筛选的分子对接呢,啊,典型的流程先确定蛋白结合位点。就是先确定结合口袋啊,这个需要一点。基础研究。如果说这个结构口袋已经知道了啊,就像那个PP数据库一样啊,已经知道了这个队伍虽然说嗯,这个有利于我们后续的工作开展,但是创新性,就是从文章的角度来看,创新性就越来就比较低了。
16:07
因为别人已经发现了,你只是在别人的呃发现的基础上做了一点改进啊,这个创新性就比较差,如果说大家有新的蛋白。比如说突变的蛋白,大家能解析出它精确的结构和原始结构的一个变化。啊,这个前人没有报道过,你报道出来了,这个文章质量就相当高了啊,相当高了。第一个呢,就是准确定这个蛋白质结合位点,第二个呢,准备化合物库。还是那句话,化合物库啊,像我们普通人啊,大家在医院啦,高校了课题组。不可能建一个化合物库,都是用官网的,都是用这个数据库的。啊,像公司的话,它会自建化合物数据库,对它进行分门别类的一个分类。比如说它含羟基,它还羧基等等等等,这个根据功能来分类,等等等等,分类之后呢,啊,我们自己做这个批量的对接啊,就是全上。
17:01
公司不是券商,公司需要预筛一遍。比如说需要羟基的啊,把那些不含羟基的直接过滤掉,缩小这个对接的范围。然后排名。每一个对接化合物啊,都有一个最佳构象,那个最佳构象的一个。啊,就那个分数排名。MU靠前。活性可能越高,我们通常取啊前多少个,比如说前20个作为候选,然后进行实验验证啊,这是整个的一个流程。嗯,整个的一个流程。右边这个图呢,大家可以看一下啊,首先这个呢是一个数据库。通常来讲,我们是官网官方的数据库。官方的数据库,然后进行虚拟筛选,一开始有这么多的一个候选人化合物,然后进行ad MED me filter.就是说进行一些化合物筛选,比如说有些有毒的呀,有些呃人体无法吸收的呀,等等等等,根据这些筛选呢,先预筛一部分,然后QA预测。
18:05
嗯,3DQA呢,这个等到我们后面再聊这个问题,那QA预测呢,其实就是刚才提到的。我们需要一些刚性的部分。比如说这个活性口袋需要5个苯环连接,那不符合的怎么样?就把它过滤掉啊,符合的有5个苯环的把它留下。啊,然后在这个基础上呢,再进行分子多些虚拟筛选等等。但其实就看到没,这是一个正常的流程。化合物库在拿到之后,其实本质上是要什么?先预筛一遍吧,而不是全上。啊,当然这个啊,需要很多的知识背景。不知道大家有没有这个知识背景啊,可能需要很多的学习啊。这个是整个虚拟筛选的过程啊,蛋白质啊,某个蛋白质结构确定好结合位点啊,化合物输入。啊,输入化工呢,大家可以看一下,对它的结构进行学习。
19:01
啊,两个苯环啊,这三个苯环通过这个氮来相连啊,这个氨基,这个氨基这是氮等等等等,把它的基础信息啊进行学习,学习之后呢,进行对接。对接啊,结合位点和它的对接,对接完之后呢,怎么样。对接完之后啊,如果发现它确实有活性,但是呢,对它的官能团,有些集团会进行改造,最后改造出来进行化合物的优化,大家看到没优化之后把这些氨基给它去掉啊,多了一个。苯胺啊,这样一个结构。这就是整个的对接的过程啊,虚拟筛选只是寻找到一些什么。可能有活性的先导化合物,比如说这个有先导化合先导有这个先导化合物有一定活性。啊,那么在结合的过程中啊,通过虚拟筛选啊,就是分子对接的结合,对它的结构进行学习之后啊。它这个化合物也要进行应用的什么。优化啊,优化之后呢,结合力更强,更加的稳定啊。
20:04
这个是整个的过程。虚拟筛选呢,有两大类啊,基于结构的虚拟筛选,需要知道蛋白的三维结构。啊,这个是什么意思呢?基于结构的虚拟筛选,就是说蛋白的活性口袋,大家有了解。要有了解。啊,知道活性口它大致长什么样。大致的长什么样,然后呢,通过一些基础知识的学习来预判,比如说他和哪些官能团有相互作用。啊,大概怎样的一个结构就能占据住它的这个活性中心。啊,根据口袋来设计化合物,这就叫基于结构。啊,我们知道口袋的形状设计一些化合物把它占住了。这就叫基于结构的虚拟筛选,还有一种呢,是基于配体的虚拟筛选,就是说。啊,蛋白结构呢,虽然不知道,但是知道有一些活性分子啊,它的结构和这个蛋白有相互作用,那么这些结构的啊,就和这个一样。
21:10
啊,知道这个化合物可能和它有一些相互作用啊,当然不止一个,可能好几个,然后就是对它的结构开始学习。啊,这有个氨基,这有个氨基对它的空间结构进行开始学习,学习完之后呢,然后进行什么分子优化,分子优化之后呢,把这个官能团改改,那个官能团改改,然后呢,每一个都去试一下。啊,官能团改改变之后试一下,看看结合力是变强了还是变弱了啊,如果是变强了,说明官能团的改造怎么样是成功的。这是两种的虚拟筛选的一个过程。啊,大家可以理解理解啊,一种是需要知道蛋白结构。啊,一种是需要知道蛋白结构。比如说。嗯,蛋白的基础研究已经非常通透了啊,活性口袋的大致啊形状知道依据这个形状。
22:06
啊,结合一些自己之前的化学知识,然后对它进行药物分子的独立设计。等等等等,比如说活性口袋。嗯,有一个什么苯环啊,有一个。啊,羟基它是带负电的,那么我在它结合的部位设计一个正电集团给它相互结合。这样的话就会形成互补的状态,那么在这些鲜艳的支持情况下,一步一步把这个可能的化合物给它设计出来。当然这个设计啊,也不是说一步能完成。可能是什么啊,可能设计了好几步啊,先对这个部位进行良好的设计,然后对另一个部位进行良好的设计,最后什么用一定的骨架把它连起来,形成一个。啊,就是独立设计的化合物。当然这个独立设计的化合物呢啊,大家先看一看对接的结果啊,可能好可能不好,需要再手动改。
23:03
啊,慢慢的改,慢慢的优化,优化出一个分子。啊,这个呢,是一个很。嗯,也是一个很火的方向啊,很大的方向就是基于这个片段的一个药物设计,这是这也是个很大的方向啊,需要庞大的学习啊,需要一些专家来。啊,帮我们指引啊,目前来讲这方面啊,这方面的人才啊,我不是我,嗯。嗯,不认识谁,不认识谁,不知道谁有这样的能力啊。第二个呢,就是基于这个配体分子的结构啊,知道这个配体分子有一定活性,比如5个分子都有这种活性,学习它的结构。学习它的结构呢,知道有一些共有的部分,比如都有5个苯环。啊,说明这就是刚性部分啊,其他的部分比如它是氯离子,它是溴离子啊,它是氟离子,而这个地方呢,怎么样,可能就是可以变化的。啊,它的变化可能就影响了活性,有的活性高,有的活性低,直接变化的呀,就是我们探索的部分,就是我们优化的部分。
24:05
需要把这个部分,需要把这个可以优化的部分,一个一个试一下,看看哪个集团的结合力更好啊,通过这样的一种方法,把这个啊的蛋白结合的配体分子给它优化出来啊,两种方式都可以啊,两种方式都可以。啊,难度上来讲啊,都挺难的。都挺难,但是非要说谁更难,当然是依据这个活性口袋独立设计这个更难啊。像这个第二种呢,知道配体结构,还能学习学习。啊,比如说看上十几二十个分子,还知道哪些可能是刚性,哪些可能是柔性,哪些可能是可变的,对其可变的进行变化试一试。好。啊,右面这张图呢,是两种独立设计的一个。嗯,流程示意图大家可以看一下啊,可以看一下啊,基于配体的虚拟筛选啊,基于结构的啊,配体呢,就是比如说都知道好多种分子。
25:01
好多种分子啊。然后学习它的结构,哎,它有个苯环,它有个苯环,它有个蛋机,它有个羧基等等等等,有的地方是固定的,有的地方是。变化的啊,这个变化的呢,可能就是需要,可能是可以改变的,需要我们对各个集团怎么样。画一画啊,看看是不是结合力更强了。而这个。而这个刚性部分呢,就是共有的结构部分呢,可能就是什么啊。啊,刚性部分啊,需要我们保留啊等等等等。然后基于结构呢,就是大家要知道这个氨基酸的什么。呃,活性口袋的一个形状啊,根据形状进行片段,主角这个片段设计个阶段,那个片段设计阶段,然后用一个刚性部分把它连起来。形成一个分子,然后进行虚拟对接,看一看是不是更好。看是不是更好啊。这是虚拟筛选的核心意义。第一个是扩大化学空间。当然了。
26:01
化合物越多,筛选的结构越准确,对吧。啊,当然是,这更多的筛选出来也是先导化合物啊,是不是这个先导化合物就是最佳结构呢?就是筛了一个分子啊,它的活性是最好的,然后呢,它是不是最佳结构呢?有可能是,但是这个有可能的概率也比较低啊,也比较低。真正的还是需要一定的优化的啊优化。然后降低实验成本。还是那句话。我们一个一个分子合成,然后去实验验证,这是不可能的啊,需要通过这个实验的方法把它一步一步筛出来。然后提高命中率。啊,真正的活性分子排在前面。啊,但是要注意啊,排在前面的可能是活性更高的,他不一定有活性啊,所以说要把前20位,前30位都作为候选进行学习啊。发现新的化学骨架。骨架跃迁这个呢,在药物设计中是一个非常重要的概念,就是前面提到的,比如说前20,前30筛选出来都有活性,它是不是有一个固定的骨架呢?
27:06
啊,这个骨架是不是和这个蛋白配体适非常适配呢?而其他的变化部分我们可以进行适当的优化。而这个骨架就需要。维持保留呢。啊,这是一个非常重要的一个药物设计,呃,非常重要的一个方面啊。从盲虫实验变成计算加实验迭代啊,在没有计算生物学之前,基本上都是盲目的测试。现在尤其是什么,尤其是我们那个中药。啊,我们那个中药到底哪些化学成分在起作用。啊,对于这个分子对接分子动力学来讲。啊,做这样的一些研究啊,非常的有意义啊,我们把中药的各个成分把它分离出来。对吧,分离出来之后,一个一个的进行对接,一个一个进行筛选,然后看哪个分子可能是活性分子,最后把它给。啊,提取出来制成药物,进行一个。
28:02
啊,药物呃,疾病的治疗。嗯,当然了,中药啊,也有很多复杂的地方,大家都知道,中药有的时候是煎的。嗯,就是拿着水来煮,煮半天,煮半天之后化合物形成了怎样的一个变化?啊,也是一个复杂的生物学过程,但是。比如说这个药物煎了之后。啊,把这喝了之后确实有这个效果,那么会把这个后的药物啊,各个化学分子都给它分离出来。然后进行啊,先虚拟对接,看看是是这个有活性还是另外一个有活性,然后进行一定的细胞实验,慢慢走向临床实验,通过这种科学的手段。来给中药什么提供更好的科学依据?啊,现在的中药科学依据还是太少啊,还是太少。啊,更多是从这个应用角度看啊,就是从经验角度看。啊,吃了这副中药可能就好了,等等,到底是哪个成分在起作用?
29:03
这一部分的空白啊,需要就是很多的研究者来从事了啊,来从事了,更多的是需要生化专业的人来做。啊,右边呢,是一个示意图。啊,结构预测蛋白准备配置,准备进行虚拟对接之后怎么样分子对接啊,批量的分子对接,然后排名。打分,最后找到最优的化合物的前20个,前30个进行啊一些判断,比如说分子动力学模拟,比如说自由能的计算啊,最后找到命中的一些化合物,然后生物学验证,这是一个循环的过程啊,循环的过程。然后呢,我们接下来来了解了解一些关于化合物数据库的一些。啊,数据格式。我们在上高中的时候,化合物都是怎么写的?简单的化合物就一行写,比如说乙醇啊,可以一行表示出来,比如说呃,简单的都可以一行表示,但是呢,随着化合物分子量的一个。
30:07
越来越复杂,越来越复杂,比如说我右下角展示的这个化合物。他该如何用这种机器语言表示呢?比如说我们人可以看啊,看是这样一种结构,那么怎么用这种书写的方式把它写出来呢?啊,如果说按照数量写,比如说氮5氢6等等等等写成这种格式啊,根本不知道结构是什么。根本不知道结构是什么,所以我们必须要有一种特殊的方式来读写这个化学结构。啊,读写这个化学结构,包括我们人也一样,人也不可能每个分子都那个,记住。而需要一种独特的。一个。编写方式来记录这个化学结果。嗯,最重要的就是化学结构的编码啊,为了让计算机高效的读写化学结构,必须采用一种比较科学的,而且唯一的就是说不能相互之间有干扰的这种。
31:02
啊语言进行描述,实现对化学结构的计算机编码。啊,方便我们检索啊,方便我们检索啊。之前给大家检索过一个。啊。啊,每个数据库呢,它的编写方式都有一些区别啊,正常来讲呢,大家可以看到几种几种方式,大家可以看一下,随便输一个啊。我们来看一看它的化合物。比如说这个花火。哼。快。看来用的人还比较多啊,我们看一下这个吧。你看它的一个结构方式啊,首先呢,我们可以用结构的方式展示2D结构。对吧,2D结构,但是化合物绝对不是2D的,更多的是什么?绝对是三维空间上的一个分子啊,三维结构。
32:06
那么计算机在读的时候直接读这个图片吗?啊,读不了,读不了,那分子式呢。比如说写成这个方式。啊,我们写成这个方式,根本就不知道它的结构是什么,如果遮住它,比如说结构不知道。啊,就知道这个方程式,大家知道这个化学结构是什么吗。不知道啊,不知道啊,这是方程式,以前我们的小的分式,比如甲醇乙醇可以这样写。碳氢三碳氧氧氢对吧,这样可以可以这样写。一旦这个分子是很复杂,像这种复杂的分子啊,你写成这样根本就不知道结构是什么。还有一种这种的。比如说这种的写成这个类似于汉语名的这种一六等等,按照编码来写。非常的复杂,需要特别的记忆啊,需要特别的记忆也不是一个最加的方式啊,也不是一个最佳的方式,因为你就算知道这个。
33:03
也很难从这个这个名称中描述出它的结构到底是什么,尤其是三维结构更难描述,对吧,更难描述。所以说呢,要有一种。独特的方式来记录它啊,独特的方式来记录它,你像下面提供了一些方式。IUPAC啊,像这种方式来写。啊,像这种的方式啊,也可以这样的,大家可以看看,其实都是非常复杂的啊,非常复杂的,外行人根本看了这串代码都根本不知道什么。它在表示什么东西?根本不知道。还有一些其他的,比如说smiles啊,Smiles相对还好点。还好点,看了之后,至少这是个集团。啊,这是个双键啊,至少还知道点儿,这个还好点儿,但是对于这个结构来讲,仍然不足啊,仍然不足,如果是分子式呢。啊,就根本不更更不知道这个结构到底是啥,完全看不出来什么结果。
34:04
所以说呢,对于这个化合物的存储啊,需要一定的。特殊的格式。特殊的格式,大家之前看那个蛋白质的PDB文件,不知道看了没?呃,大家如果看了那篇文章,我推过我推的那篇文章,或者说直接打开一个PDB文件的话,看看里面到底的格式是什么。每个原子呢,都有什么,都有一个三维坐标。而且什么。而且里面有各种各样的信息。对吧,成见信息等等等等等到我们在做分子对接的时候,要对这些成见信息,怎么还要进行原子分类,加氢加电荷等等等等这样更为复杂的一些操作啊,对于我们的化学分子是也来来讲也是一样的。整个的分子式啊,需要一定独立的编写机制。方便存储、读取和分子对接。
35:01
啊,现在流行的呢,有这几种。系统命名码,碎片码,线性码啊,拓扑码和连接表啊,这几种方式呢,都有运用啊,都有运用。啊。这种呢是最常见的,也是刚才在那个大家看到的那几种。啊,Smiles啊,起码还知道大致的啊,是这样一个集团还好点儿,你像应这个呢。啊,它是唯一的标识符,但是看了这个标识符也不知道对应的是什么东西啊,像这种关键词呢。啊,给他一个ID啊,其实也很非常复杂,分子指纹呢。分子指纹其实就是把这个化合物啊。嗯,变成机器语言输入到这个机器中,比如01啊,我们的机器都是01。需要把这个机呃化合物当成机蓄语言输入。然后分子图呢,Graph.Graph就是节点和边,就是这种结构,刚才看的那种,就是把这个2D结构和3D3D结构给大家。
36:02
输进来变成这样一种。啊,当然我们实验过程包括这个。对接的过程啊,都是需要它的3D结构啊,3D结构。然后是3D坐标XYZ。3D坐标呢,啊,纯3D坐标是不够的。啊,纯3D坐标是不够的,比如说知道这个碳3D坐标,那个碳的3D坐标,也要对它的这什么成见的一些信息进行描述。比如说有的碳是阿尔法碳。有的碳呢的贝塔碳啊,不同的化学环境,碳能行驶的化学功能其实是。不一样的啊,通过这种多种信息的叠加呢,比如说既有它的3D坐标。又有它的一个成呃2学环境信息,比如说它分哪个,比如说和氧离子形成了这个共建啊,2呃双键啊等等等等这样的一些键的描述啊,加上3D坐标才更加的完整。而这种文件通常叫拓扑文件,拓扑文件其实本质上就是涵盖了多种信息。
37:04
然后要分子描述符,那分子描述符呢,其实就是什么。比如说这个苯环,我用一个特殊的字符描述啊,那个是其他的结构用一个特殊的字符描述,然后化学物分化合分子呢,就是把这些特殊的结构什么呢。连起来,连起来。啊,目前来讲啊,目前来讲最常用的。最常用的啊,就是展示出来的这几种啊,Smiles的化学结构,展示一个真实小分子的二维结构,注意,只是小分子啊,只是小分子。啊,大分子的话,这个确实很复杂。看不出来。比如说这个阿司匹林,用这个smiles展示,展示成这种形式。没有点功利的人,就是对这个没有没有在这个行业从事好好很长时间的人啊。根本就看不出来这个结构到底在干什么。
38:02
它的三维结构,二维结构到底是什么?啊,看不出来,虽然它比较紧凑简单,但是呢。这个一串的这个字符对应的这个二级结构对应的三级结构啊。其实存储起来也是非常复杂的。复杂的。老公。当然了,这种方式呢,机器读起来方便啊,读起来方便,呃,关键是要建立什么。一一的对应关系啊,输入这样一个字符,知道它的是二维结构是这。当然我们还对我们人来讲,确实难度比较大啊,难度比较大。第二种呢,就是smiles啊和INS和INSK的这种方式啊,刚才pop大家也看到了。啊,因此啊,这么长是吧,K这么长。
39:03
外行人看了根本就不知道在说什么。啊smiles啊,这样一种结构啊,这种结构相互这个结合起来呢,确实机器的语言来讲,读取是相对比较容易的。啊一种一张图同时呢展成3种编码,3种编码多种编码,大家看到没。Smiles是这种应是是这种啊,给他一个标识符可呢,给他一个关键的ID。啊,数据库进行存储,唯一的进行存储。啊,适合解释不同化学结构表示方法之间的区别啊,区别。分成指纹呢?分子指纹呢,就是展示分子结构,经过算法把它转换成01了,就是机器语言,我们的机器语言进行展示,然后呢,进行两个分子之间的。这种比较,这种比较。啊,对于我们虚拟筛选来讲,通常采用的啊,通常用到这个。就是哪些集团哪些部分是相同的,哪些部分是相似的。我们人可以看。
40:04
我们人一看啊,都有个苯环,他们想死,那机器语言怎么看呢?啊,他们这个苯环转化成01结构之后,发现这个零一的这个序列呢,大家都一样。啊,那么就是它的一个什么刚性结构啊,刚性结构。第4个呢,就是化学结构的这个graph啊,就是直接展示它整体的二维和三维结构,这种呢,对于我们人来讲是最友好的,一眼就能看出来分子的一个构象是什么。啊,但是对于机器来讲确实比较的复杂,存储起来是比较复杂的。对于我们,呃,无论是用PAL,还是用这个moe,或者说用这个winner。对接的时候呢,我们都用到这种三维结构的对接,它方便我们人来操作。我们对一些集团进行啊旋转啦。这个查看了等等的方便,这种我们用计算机来查看。啊,方便这种查看,这几种方式呢,都有它单独的一个优势,都有它单独的一个优势,其中对人友好的就是直接展示三维结构。
41:06
对计算机相对好的就是啊前3种。啊,前三组。当然了,现在的数据库啊,一般把各种都给它罗列出来了,大家觉得哪种好就用哪种,对于人来讲啊,读取这种序列。读取这种序列。啊,其实是很麻烦的,需要建立起什么这种序列和它本身的二维结构,三维结构的一个对应关系。方便我们搜索查看啊。呃,碎片码系统呢,是讲化学结构呢,首先分割成结构片段啊,这些片段可以有一定的化学意义,比如说苯环怎么写,羟基怎么写,就是说有一个独特的字符来代表这个官能团。最强烈的官能团环系统,然后再加以表述的一种方法,比如说乙醇怎么写?就是甲基和羧基的什么。
42:01
啊,用一些这个碎片码的方式把它连起来就行了。啊,基本上可以处理计算机对化学结构的一些信息的存储。啊,但是呢,随着发展呢,发现他对碎片板描述的什么。检索啊,结构检索被应用被限制了,因为后来越来越复杂,越来越复杂,写的时候呢,就更为的麻烦啊,更为的麻烦,现在已经应用的很少了,很少了啊。线性码或者线性标记呢,最早出现的是打字符。啊,包括我们现在打字什么,只能出行排列。就是这种。类似于smiles这种一行展示。啊,一开始呢,需要这种展示方式。啊,不过呢是吧。看了那一行字母字符字符串。很难知道它的,很难想象出来它的结构到底是什么。根本不知道。啊,根本不知道啊,需要我们一一对应啊,所以说在结构处理就是二级结构三维结构的时候,基本上不采用这种方式。
43:05
嗯,当然了,现在随着发展呢,更多的什么数据库啊,更庞大的数据库进行。对吧,庞大的数据库进行一个交流啦,调取啦等等等等,碎片码由于浓浓高度浓缩化学结构而十分适用于远程通讯。啊,远程通讯在网络上传输时速度快,错误率低的优点。啊,使得他们又得到了广泛应用,目前使用的是这个的编码,就是这种的,比如说阿司匹林就写成这样。啊,这样呢,对于机器来讲,传输呃运输呃,这个这个存储啊。啊,传输来讲是比较好的,但是对于我们人来讲,还是很难看清楚它的结构是什么。像阿司匹林是这样一种结构。啊,写成了这个smells,就成了这样一种结构了。啊,很难对应啊,必须呃数据库帮我们存一下,让我们看一看啊看一看。然后还有拓扑指数码和连接表啊,这里面都进行了一个详细的描述啊,直接描述分子中结构单元的性质及相互关系的编码,能较好的反映原子之间的关系,说白了它更多的是什么。
44:13
拓扑指数嘛,就是研究它的拓扑结构的每一个独立的官能团之间,以及他们之间的一个和其他的官能团之间的相互作用,描述这样一个作用。你像乙醇。乙醇是这样一个结构啊,它的当然写成分子式是这样。能够反映之间的拓扑关系,比如说连连接线。构象变化不明显,也就是说它如果发生构三维构象的转变的话,拓普码还是一样的。啊,通过还是一样啊。便于具象和比较啊。常见的拓扑指数,指标,连接指数啦,分子指数啦,环指数啦等等等等,都是一些指数啊,指数用于描述分子的拓扑结构,其实就是用于描述分子之间的什么相互作用力。
45:00
它和哪些有相互作力,形成了共价键。这是突破之数,连接表呢?原子之间怎么连接的,说白了。啊,碳和谁连接,比如说1号碳和3个氢连接,2号碳和2个氢连接,和1号碳连接,这样的话,通过这种连接的方式来展示分子之间的相互关系啊,相互关系。啊,就这样一号碳连接的编制234对吧,它和几号氢连接等等等等啊常见的格式呢是sdf Mo PB啊,我们之前展示过啊,用的也是pdb smells each啊,Each.数据库呢,通常SDF多一点,SDF多一点。所以说呢,这个本身的这个化学文件啊,它不仅展示它的三维坐标,也要展示它们之间的相互关系,展示它们之间谁和谁形成了共价键。才形成了这样一种含有多种信息的拓扑文件。连接表啊,连接表。透布指数,呃,指数码和连接表啊,实际上这个我们的这个。
46:02
啊,化合物分子啊,可以用机器的语言进行什么存储啦,计算啦,包括我们分子对接啦,分子学,呃,分子动力学啦,包括现在所要讲到的虚拟筛选了,都是在这个基础上才能进行啊,才能进行,如果单独只描述这个原子的三维结构,比如说1号碳。啊,三维结构是什么?阿尔法碳不描述它和哪些原子形成了共价键,我们是不知道的。根本不知道它的三维结构是什么。而我们做研究,做分子对接,做动力学,做虚拟筛选。都是要在原子的三维结构啊,在那个分子的三维结构基础上进行。嗯,包括这个计算啦,实验验证啦,等等等等啊。好了,我们休息5分钟吧,休息5分钟,我们看看后面的部分啊,休息5分钟。
51:27
啊,好啊。前面的内容呢,我们基本上讲了这个化合物存储的一些方式,以及它的展示形式啊,我们来整整啊,第一里的关于这个分子结构的一个。城市啊,一级结构就是一行写。一行写,比如说几个碳,几个氢,几个氧等等,用一行写。这种呢,最简单啊,但是呢,根本看不出来什么。啊,具体的结构,不知道它具体结构是什么。像这种分子式写成这样,线性码写成这样的,根本看不出来,看不出来,但是它只是方便存储。
52:04
包括原子排列的一些信息。二级结构呢,就是它的二维。就这样的一个单词。啊,包括smells啊,包括它的展示形式啊,都有一些限制性展示形式。2位。3维呢?立体结构,这个是最我们在啊研究过程中最重要的。二维结构呢,看不出来它的一个偏转角之类的。而它的三维结构呢,就会看出来它整体的这是什么空间上的一个相互关系。啊,这里面给大家罗列了3种的这个。结构的一个解读。分子中原类的原子的排列形式啊,线性码就是这样的。2D分子要展现他们的建联情况,谁和谁连啊,这个碳连了3个氢,这个碳连了2个氢啊,一个甲基一个。哦,氧H啊,一个氧。要把它的这个相互之间的什么化学成见信息给它展示出来。
53:03
三维结构呢?不仅要展示他们的城建结构,还要展示出它的什么空间排列。这和我们的分子对接、分子对动力学有关。啊,胚体分子进入到蛋白活性中心怎么样,它是三维结构进去的啊,是立体结构和这个空腔就是结合,呃,煤火中心结合位点啊,是三维结构相连啊,之前给大家无论是绘图啊,还是怎样的,都是从三维结构的角度出发来进行分析和处理。总结一下就是1D啊啊,一维结构就是原子排列,二维结构呢就是建联关系。哪些碳和哪些要啊,哪些新有间联关系,3D结构呢,要展示空间信息。相互之间补充啊。在smiles啊连接体系中,按混合价模型,比如每个原子被氢原子饱和了。
54:01
啊,像这个呢。甲烷啊,这个碳呢,就用这个氢,呃,每个都占据了氢,那smell嘛,就把它写成碳。默认其他都是氢,如果是铁2价呢,就写成这种方式。啊,氢氧化钠呢,啊是这这么是把这存储的时候写成这样。啊,钠是正价,这个呢是负价,还有什么乙烯啊,两个碳氢2之间相连啊,氢硫不表示了,直接碳相连就可以。乙酸。啊,直接形成这种方式。啊,什么码呢?其实对它的整体结构啊有一些省略,之前我们学化学的时候写的都是这种形式。啊,什么样什么呢,为了方便存储,写的形式呢,进行了一定的书写和简练。那苯环呢,环己烷呢啊形成这样的123456,碳一碳一等等等等,说明它是一个环,碳一和碳一什么头尾相互形成一个环。啊,无氧含五元含氧烷啊等等等等这种方式啊,Smile就是这种方式存储啊存储。
55:02
当然我们人读的比较费劲,机器它能识别。啊,我们串2级的结构就是把分子式和连接包连接起来,分子式呢,就是刚才提到的一维的。连接表呢,就是要告诉我们,告诉我们原子之间成情况。这个和这个成见了,这个和这个成见了,这个和这个成见了,就像这种一样。他们之间的承建信息是什么?啊,当然了,没有包含三维结构信息,这种结构呢,用图表示,大家那个药物的说明书啊,基本上都是这种结果。大家随便拿一个药,把它的说明书拿出来,它的药物分子啊,都是2D结构。啊,用一种当然了,用这种这种线。正式的表示一下3D结构,这种呢是朝前啊,这种呢是往后啊。当化学分子被简化成原子,用电啊代表并用线连接的方式时,这种图叫做拓扑图啊。
56:04
表示这个拓扑图的这个文件叫什么?拓扑文件,像大家之前给大家展示的PDB啊,包含了多种信息呢,都是要拓文件。只表示原子之间的连接和近啊,原子连接和近啊。3D呢,3D大家看到了,基本上就要展示整体的一个完整的空间信息了。嗯,化学分子的3D结构通常采用直角坐标法。D看2坐标和内坐标法来描述原子,各原子之间的空间排列。我们上这个高中的时候学过这个笛卡尔坐标。数学上学过题,卡尔坐标,但是不知道有什么用。啊,就是当时学的时候知道笛卡尔坐标是一种旋转轴的方式展示一个空间信息,它到底怎么用并不太清楚。嗯,等到大家学了这个化学专业,发现啊,这些都是有用的,都是有用的,只是他用的地方啊,当时没学到。
57:00
啊,它只有用这种笛卡尔坐标展示的形式呢,才能准确的展示它们之间的关系。比如说这个坐标。氧和它呃三维就呃三维的信息在描述的时候,大家可以看到,比如这个这个。这个这个承建了,这个也成见了,它们之间的角度是多少呢。而D和2坐标就能准确的描述这个信息。大家知道笛卡尔坐标是啥吧?不知道的回去复习一下啊。啊,直角坐标法呢,不含有连接信息,可以建立完整的连接表做补充啊直角坐标法就是它的三维结构是啥。啊,123123123是吧。像这种的二维坐标,形成这样三维坐标,我们呢,我们要看到它整个的建连共价键,三维结构以及建角。啊,它的角度是多少。这个呢是这个直角坐标法的一个体系。大家学那个高中都学过,直角坐标法和T-2坐标都学过。其中迪2坐标法来描述它的建联信息,包括这个偏转角度啊,是非常的合适的啊。
58:05
非常的合适,只是当时我们学数学的时候学到这个了,学化学的时候看过它的2D分子啊,当然了,那个时候没有教什么3D分子,3D结构。所以说笛卡尔坐标如何和化学结构联系起来这种交叉学科呀?呃,我们上学阶段是没有学到的,所以说很多都是割裂的,当我们嗯,学的越来越多,越来越深的时候,把这些都连起来之后发现,哦,原来他是这样用的啊,原来他是那样用的啊。啊,内坐标法的话,就是用见长见角二面角来描述它们,每个原子是通过它与参考原子的相对位置来定义的。啊内坐标法。这种呢,在化合物的这个描述中也是非常的。重要的应用的是比较多的,比如第一个原则,没有参考坐标,没有任何信息,只有元素类型,比如说碳。第二个原则呢,就是和碳这个距离。
59:01
啊,第二个第三个原子形和这个碳的这个夹角是多少。啊,描述这个三维坐标啊,第4个及以后的原子除了信息啊,除了间距间角之外,还有第三个原子的二面角是这样的。比如说第一个原子是碳,第二个原子呢,比如说是氢啊氧,它们之间的键长是多少,键轴是多少等等等等,第三个原子是怎样?第4个原子呢,在它的基础上连接的时候,比如说也是个氢,它们之间会形成一二三形成一个,呃2形成一个面啊142也形成一个面,它的二面角是多少?这样的话描述信息啊,三维信息描述的足够准确啊,足够准确,当然这是一些简单的例子啊,真正的这个内坐标法,在描述一个完整的分数的时候啊。它那个文件写的也是相当复杂,相当复杂,大家只有在这个专业深耕多年,才会真正理解它到底是怎样一种表示形式啊。嗯,分子的三维结构啊,必须存储为一定格式的文件,才能被计算机软件所正确识别。
60:04
当然我们人可以看它的图形,为什么看它图形二维三维,二维的话最直观,三维的话需要借助一些软件进行旋转来看,就像叫拍帽软件或者其他的moe啦等等的,或在线的一些软件来看它的三维几个信息。啊,而我们做任何的分析啊,都是从三维信息来看,这三维信息既包括什么原子坐标。共价键还有什么?还有它的一个角度啊,每个原子形成的角度,以及每个官能团之间的一个具体关系,包括什么电荷信息等等等等,守性体系等等等等,做分析的时候,把这些所有信息都要进行考虑啊,都要进行考虑。啊,除了结构之外,有什么电荷啦,属性啦,物理化学性质啦,注释啦等等等等,所有的信息都要在我们。分子对接动力学虚拟三线中要考虑进来,考虑进来,当然这些软件啊,已经把这些都给我们啊写好了,我们用前人的方法就可以做一定研究,当我们深入到内部。
61:03
构建新的计算逻辑的时候啊,这些都是我们需要考虑的信息啊,考虑的信息。嗯,由于化学结构文件包含的信息不同啊,就像前面那种多种格式一样,它主要体现222维信息,它主要体现三维信息等等等等。两个化学软件之间毫无损失的传递化学结构信息啊,比较困难啊,2D转3D 3D转1D啊等等等等,想要完整的转啊。啊,相互切换是有难度的啊是有难度的,如果文件不合适,信息丢失,整个的后续分析怎么样。都是错的,都是错的。然后化学结构的一个存储。Smile.这个呢,已经给大家介绍过了,More呢。目前是最应用最广泛的一种连接表。连接表是干嘛?原子之间到底哪些成见了,通过这种连接的方式来表示?
62:03
冒呢是目前引用的比较多的一个方式,冒柱呢。啊,新开发的一种方式,新开发的一种方式啊,运用的也是比较多。PDB呢,这个时候是在我们演示过程中用的比较多。啊,存储了蛋白信息。它有结构信息,有构象表征,就是可以看它的三维结构,但是构象表征的,构型表征的,它能不能动的,哪些地方能动的。啊,这个不能看啊,看不到不能动态的看。三维坐标呢?啊,只表示它的构象。啊类矩阵呢。啊,表示它的一个也是表示构想啊,目前常见的就是M和SLN格式,几乎的所有化学软件采用连接表来存储化学结构。连接表就是每个原子之间哪些原子成键了,成了共价键啊,或者说成了这个。啊,苯环碳碳苯环二键三键等等等对它进行连接。重度的分子存储结构中啊,应用最广泛的就是冒冒兔和PDB。
63:06
PDB.担保有三大缺点,第一个,电荷信息不能存储。啊,包括PDB也没有存储。啊,仅保证原子信息啊,更为精准的信息不能采用Mo。啊,猫文件不能存储氨基酸信息,只是只是个小分子啊,只是个小分子。我们的蛋白质大分子是怎么存储的?啊,PDP居多啊PDP居多。包含多个Mo文件,一般定义一种新的格式及SDF格式,这也是数据库常见的格式啊,Mo文件呢?在它的基础上进行了一定的改进啊,存储了它的原子类型,电荷建联等信息,适合小分子存储,猫兔呢,是大家需要掌握的一种。文件格式啊,文件格式啊,目前小分子数据库啊,常用猫和猫兔的存储格式居多。啊,生物学大分子呢,基本上是冒突或者PDP啊,我们常用的是PDP。
64:00
PDB分子。嗯,这种呢,猫兔呢,通常我们作为虚拟筛选的一个。格式。这是moto的格式,有注释信息。有体系,有电荷啊,有原子数目,化学键数目,子结构数目等等等等,把这些所有的结构呢都存储起来,形成一种拓扑文件。包括这种三维坐标原子类型啊,原子编码原子类型三维坐标原子类型是什么,还是那个。相同的元素,比如说碳,在不同的化学环境中,它的功能是不一样的啊,要把它区分开来,这是阿尔法碳。这是苯环碳等等等等,把它区分开来。原子所属的子结构及号称啊,可以省略。这个是什么?电荷信息啊,电荷信息这个是什么化学键信息。啊,几号碳和几号碳形成了共价键,几号和几号这个氧原子形成了共价键,连接表的形式告诉大家哪些原子相互之间形成了什么。
65:05
啊,有建联的信息形成了共价键。啊,一个文件就包含了这么多信息了啊这些。最后呢,我们来学一个工具,就是一维二维三维相互转换的一个工具啊,Open.Bible.啊,这是一个开源的工具呢,我们直接用即可啊,它可以直接在分子之间进行一维二维三维之间的一个转换啊,转换非常的方便啊,非常的方便。基本上它的格式就是这样,Open b, 杠I是输入,输入的格式是什么?跟到后面,然后写我们的文件,然后杠O是输出的格式,比如说输出PDP,然后杠大O呢,输出的一个名字。啊,名字我们来试一下,比如说。哦,我之前。嗯,以泡泡看为例啊。
66:02
比如说说一级F2化合物有这么多,这里面有下载信息,当的信息我们可以下载,下载的时候呢,大家可以看到数学化学结构信息有这种格式,SDF格式Johnson啊这是文本格式。网页用的,我们通常下这个SDF,但是呢之前啊。下3D啊,当然可以直接下2D和3D,之前呢下3D是全下的,现在呢,这个数据库进行了更新,3D结构只能最多下10个。啊,3D结构只能最多下10个。啊,我们直接下二级。不要压缩直接点。就可以把这个文件给下下来,另存为即可啊,这边我已经下好了。下到这个上,下到这个文件来了,2D分子。作为一个示例,像SDF呢,是一种存储的格式,之前在那个用软件识别。结构的时候呢,也是这种格式。然后呢,我们在做分子对接的时候,需要把它转化成什么三维结构,刚才大家也看到了这个结构呢,怎么样,我们想要批量下载,只能下载二级结构,想要下载这个3D结构啊。
67:11
啊,那最多能下载10个,这个太少了,我们需要还有320个都下架的。都下来,它只是二级结构的SBM,而且是一个文件存储,嗯。大家如果感兴趣的话,可以把这个文件打开,都看看是什么内容。你像第一个文件。啊。第一个文件是什么啊,三维坐标,溴离子等等等等,它存储了一些连接表的形式啊,数据格式。啊,化学键等等等等等等。存储了多种多样的信息。啊,包括他的这些。啊,ID.Com的ID啊,Inch啦,等等等等,他们每每个信息都进行了详细的存储啊。大家可以看一看,它是把好多分子,以我们这个为例,就是把320个分子都给它揉到一个文件里去。
68:02
这个时候呢,我们想做虚拟实验卷,需要把这个分子都给它拆开,并且形成3D 3D的话,我们就要用open Bible这个命令。大家把open装好之后呢,就直接可以用。啊,我们先看看它这个输入参数。大家可以看到的。啊,核心的就是钢。I.然后呢,输入格式输入文件杠O输出格式输出文件啊。即可啊即可。然后呢,这是主要的,还有一些其他次要的,比如说杠F。啊,其他的important and分子啊,特异化对不对,用哪个分子作为开始,320个分子,哪个分子是第一个。啊,一般我们不需要指定啊,其中有个关键参数是杠M。我们要把这320个分子都给它拆开,拆成一个一个的啊,一个一个的,这样有利于我们做虚拟筛选。
69:00
一个一个的。然后呢,还有一个参数是什么。3D啊,我们需要3D的结构。接下来我们把这个命理运行一下。我们输入的是SDF格式。杠ISDF,我们的文件杠O是输出PDB啊,输出PDB的名字是冒点PDB。杠M是把它。挨个拆分,然后呢,每一个文件形成一个3D结构,这个3D结构它软件本身会进行一定程度的优化,让它呈现出能量最小的构。啊,怎么呈现能量最小的构线呢,之前给大家。讲过对吧,之前给大家讲过手动的防护啊,手动的方式,包括这个Windows软件的方式呢,啊,用那个开3D啊,可以可以这个进行能量最小化。啊,通过这种分析的方式呢,Open Bible可以给大家一个能量需求化的一个内部算法,啊,直接把它优化优化好。啊,这里面已经有一些分子转化出来了,我们随便看一个啊。
70:07
随便看一个。比如说看第10个分子。啊,就是这样的,看到没。三维结构,3D结构啊,我们下载的文件是2D结构,软件呢,可以给大家一些3D结构,给它一个能量最低的一个构象啊这种构象。那这种呢,就属于什么非极性氢啊,转化出来了都。我们在做虚拟筛选或者分子对接的时候,用到的就是3D结果啊。啊,转化完了吧,啊还没有。啊,一共320多个分子啊,它需要一个一个给它转化出来,现在转化了100。100多个吧,一百不到200个。啊,需要点时间就好转化。
71:01
I度啊,3D坐标产生field啊,有的分子3D坐标产生失败了。啊,说明有的分子在转化的过程中出现了问题。正常来讲啊,我们直接把它转换好就可以啊,像我们做这个课题,需要这个虚拟转化,虚拟转化啊,在公司啊,一般都有一个数据库,专门存储它的3D格式啊,最低能量格式即可啊即可。好了。这就是转化的一个命令啊,我们把它转化出来即可,当然我这是转化的PB,大家想转化成猫兔呢?把这个地方写成。More to就可以了。然后。这个地方也写成冒格式,直接运行的话就会转换成格式。啊,这个软件就会进行。每个文件之间的这个格式的转化啊转化,当然还是那句话,前面提到过。
72:02
啊,毫无保留的转化呀,其实是什么比较困难的软件也是尽量的。维护啊,保持它原本的信息啊,原本的信息不可避免的会有一些损失,最好的情况就是什么,独立建立3D的一个数据库。独立建立15%,或者说什么。有些数据库大家挨个下载,把它的3D结构直接下载好啊,当然限制你下10个了啊,现在限制了,我们只能2D来转换,之前直接下载3D运用就可以啊,运用就可以,各个公司呢,都有自己独立的数据库,建立了3D的信息啊,这样的话在虚拟3D的时候会非常的方便啊,非常的方便。啊,当然这只是一个数据库,还有其他的数据库,之前给大家讲了好多个数据库,每个数据库都要进行类似的转化,做我们虚拟筛选。
我来说两句