00:00
今天我们要讨论的是。一些有用的计算方法用于蛋白质注释。所谓注释annotation是指。我们可以对序列执行多种分析。例如确定功能。确定结构域,跨膜区预测二级结构。溶剂、可及性等等。还有很多。可以做的分析在开始之前。我先给大家介绍一些。基础知识。例如,为什么我们需要知道?蛋白质的功能。我们从数据库获取蛋白质序列后。接下来。注释意味着要找到该蛋白质的。具体功能总的来说。研究蛋白质功能的方法。正是要弄清楚到底发生了什么。当该蛋白质缺失时会发生什么。因此。
01:02
大多数。科学家会使用实验系统。例如细胞培养方法。或整个生物体,并将其用作模型系统。在其中测试特定蛋白质或基因的功能。通过基因敲除或修饰该基因或蛋白质。观察表型。在该基因缺失或发生变异时的变化。这可以通过各种实验方法完成。例如。印记技术,还有更高级的。微阵列、micro ary等方法。方法有很多种,它们能解决什么问题?
02:00
正如我所说。蛋白质功能预测,之前的视频讲过。而实验方法并不像我们想象的那么简单。任何计算方法都需要大量资源。巨额资金。大量人力才能完成分析。而且成功率往往很低。尤其是在确定。蛋白质混合物的功能时。因此。另一种途径,计算方法。对我们来说是一个很好的替代资源。用来理解或确定。该蛋白质的具体功能。它有哪些结构域?跨膜区等等,我们可以做很多分析。这里只举四五个例子。
03:00
根据你需要的注释类型。有几千个。几十万个数据库和软件可供使用。你可以用它们进行预测。那么今天。我们将探讨各种蛋白质序列注释方法。利用这些工具,我们可以预测和识别蛋白质的理化性质,结构域、保守区域、跨膜区、活性位点。二级结构元件溶剂。可及性和膜体motifs。需要记住的是。我们讨论的是氨基酸序列,而非结构。因此将使用单字母氨基酸代码来完成。所。有注释在本视频中。
04:01
我将使用最常用、最顶尖的工具用于各种蛋白质序列的分析。那么让我们首先来看。蛋白质的理化性质。我们主要使用。XPSY的PRO per工具。它是计算理化性质。最好的工具之一,如分子量。理论等垫点。原子组成消光系数,估计半衰期。不稳定指数等。这些都可以轻松获得。使用expsy的PRO perem.还有另一个几乎一模一样的。工具叫做pepro。它可以绘制钛的。二维结构。你可以用peprol绘制肽。
05:01
我们来演示这两个工具,看看他们。是如何操作的?好的界面是这样的。这里需要输入序列好的。这里是protem。这是一个工具,其名称亦为。蛋白质参数工具protein。Parameter tool首先。这里已经有一个序列。我将使用同一个。我的序列名称是CES。基补体CES亚基。
06:01
我将使用相同的序列。这些数据库获取序列。你只需粘贴你的。氨基酸序列。如果你知道该蛋白的UNI PRO ID.也可以在这里直接提供。然后点击计算参数。Compute parameters.这不会花太多时间,很快就能得到结果。在第1栏中,它会显示你输入的序列信息。这里显示的是序列总览。首先,你会看到氨基酸总数。可以看到该蛋白有631个氨基酸。接下来是分子量。即蛋白质的总分子量。这是理论等垫点拍。数值为8.69。你还可以看到每种氨基酸的组成,例如丙氨酸有28个残积,约占4.4%,还可以看到蛋白质的总电荷。
07:09
酸性残疾天冬氨酸。谷氨酸有83个。碱性残疾有93个。还有精氨酸、AG等。你还可以查看原子组成。即蛋白质中各类原子的总数。它还会。显示分子式和原子总数。这里都会显示。它还会给出一个很有用的参数。消光系数extinction。Coefficient.他表示,蛋白质在特定波长下能吸收多少光?这非常重要。当你研究。蛋白质酶动力学时。
08:02
他对你非常有用。可以帮助你确定在什么波长下。蛋白质稀。收多少光,它还会显示。半衰期、half life及预测。该蛋白质在细胞中合成后多久被降解?该预测基于三种生物体给出。Prot per软件的估算基于N。端氨基酸序列。该序列会给出该蛋白质的半衰期。例如,该蛋白在体外哺乳动物细胞中。为30小时。相比之下。在酵母和其他生物体中则不同。他还会给出。
09:01
不稳定指数instability index.该指数。反应蛋白质在试管中的稳定性。及你的蛋白质。在体外是否稳定。如果该指数。小于40,则蛋白质稳定。如果大于40。则不稳定。也就是说,这种蛋白质。在试管中完全不稳定,无法得到准确的结果。最后一个参数是脂肪组指数allofati。C index他表示。脂肪足侧链,如丙氨酸、缬氨酸。异亮氨酸亮氨酸。所占的相对体积可被视为。
10:01
提高蛋白质热稳定性的积极因素。因此称为脂肪组指数。他会给出具体的指数值。最后一个参数是。总平均亲水性gravy。他表示序列中所有。氨基酸亲水性值的总和除以序列中的残。计总数。从而告诉你该蛋白质序列。整体的侵水性水平。以上就是protem提供的基本信息。如果你正在表征你的蛋白质。这些信息都可以用于你的论文或。发表好的以上。就是prot peremm的简要介绍。接下来介绍另一个工具pepraw,它与prot peremm类似,但有自己的局限在理化性质方面。
11:11
最好使用PT perem.接下来我们看petpro工具。好的,这是paprol的界面。需要提供氨基酸序列。或者也可以自己绘制序列。例如。我想绘制。这样一个序列。你可以看到我可以轻松绘制。只需点击绘制draw。Papro的一个优点是。它会生成二维图。并显示一些基本参数。如等电点、pii电荷、输水性、消光系数以及长度、分子量等。
12:05
T的相关信息,但它有一个主要限制。Peprol最多只能绘制60。个氨基酸的肽。即最多60个氨基酸。长度不能超过60个氨基酸。因此,如果你想绘制一个小肽。它非常实用、灵活。适合保存二维图和获取基本信息。但正如我所说。如果你要计算理化性质。最好使用XPSSY的protem。工具。好的,第一个工具就到这里。接下来我们看。第二个工具,蛋白质结构预预测。目前有三种不同的工具,分别是inter PRO smart和FA。
13:05
这是我们将要使用的三种工具。用来确定蛋白质的结构域。首先,先来了解一些。结构域的基本概念。结构域是蛋白质中具有功能。和结构的一个单元。通常承担特定的功能或参与。与其他蛋白质的相互作用。总的来说。结构域在蛋白质中发挥主要作用。那么我们如何?在未知蛋白质中识别结构域呢?我们将使用三种不同的工具。PRO smart和。Fam, 我先关闭这个窗口,然后进入。
14:06
好的。这是MBA Abby的inter PRO页面。界面非常简单。不会故意复杂化。你只需提供单字母氨基酸序列。这里我已经复制了要使用的序列,在这里粘贴进去。先简单介绍一下inter PRO, 它是一个提供功能分析的资源,通过分析蛋白质序列。将其分类到家族预测结构域。和重要位点。因此,Inter PRO始终是。结构域分析的最佳选择,尤其适合结构域分析。原因是他使用称为。
15:05
签名signatures的预测模型。这些签名由。多个数据库整合而成,这使得inter PRO成为一个数据库联盟。与其他数据库如fame。Smart不同。Inter PRO是多个数据库的组合。而不是某个特定数据库。它由约14个数据库组成,这就是为什么我们在研究中总是优先使用inter的原因。如果你研究结构域。这里我已粘贴好序列。点击搜索即可。大约需要2~3分钟就能得到结果。完成后会显示结果,任务就完成了。你只需点击。
16:00
这里的链接就可以看到非常漂亮的。结构域图形以及各个数据库的预测结果。例如,这里SHR结构PRO预测位于第245位。到第三、四、五位,氨基酸向下滚动一些。可以看到。Smart数据库的预测,其结果与inter PRO几乎一致,预测范围为245~336。继续往下。这里还有更多内容。可以看到fame的预测结果。还可以看到其他多个数据库的预测。为你提供各种结果,包括活性位点。结合位点保守区域。以及该蛋白质属于哪个家族。
17:01
同源超家族等。通过与多个数据库比对得到这些信息。另外你可以下载。整张结构域图片。如果只想查看。某个特定数据库也是可以的。点击这里。可以选择任意数据库。例如,如果只想看家族预测,可以选择fame,这里可以看到5个不同的结构域。Fame中。第一个结构域是酪氨酸激酶TK结构。郁。位于第37位到第680位氨基酸,这里还能看到其他结构域。如BTK结构域、PH结构域、3结构域共5个结构域被FA识别。如果只看PRO。
18:00
可以看到14。组不同的结构域被预测出来。因此,通过inter PRO, 你可以轻松获得。全面的结构域信息。为什么说它独特?因为14个不同的数据库整合t PRO中,这就是为什么我们总是优势使用inter PRO做结构与分析。下面我们来看另一个数据库,Smart, 好的。Smart是EMBA开发的工具。输入smart的网址。会打开他的主页。在这个数据库中需要提供序列信息。或者如果已知登录号accession。直接提供登录号,也可以提供登录号,或者只提供序列即可。
19:03
这里我只提供了序列。也就是我们已知的补体CES。的序列,输入后点击提交可以看到。它会生成一张漂亮的结构与图谱。供你参。Call.可以看到你的蛋白质有一、二、三五个结构域。这是smart的预测。与PRO。中显示的结果非常一致。显示了类似的结果。这里可以看到PH结构域、BTK结构域、SH3结构域、R结构域以及酪氨酸激酶TK结构域。并且会告诉你每个结构域的确切起始和结束位置。
20:03
以及期望值e value.1值越小,结果越显著。他还会提供基本信息。如果你点击某个结构域,它会显示。该结构域的功能。因此。基于结构域的功能。我们可以轻松预测该蛋白质的功能。正如我之前所说。结构域是蛋白质中。功能性和结构性的单元。他们决定了。该蛋白质的具体功能。这里Smart台。为你提供该蛋白质的其他基本信息,例如架构architecture,它会显示结构域架构。相互作用,Interactions.会跳转到string数据库。
21:01
查看哪些蛋白质。与它相互作用。通路passways会显示。该蛋白质参与哪些主要通路可以看到?他在踢。细胞受体信号通路中起重要作用。在直系同源orphology中。可以看到该蛋白质。在其他物种中的同源物。这里主要是。酪氨酸激酶。也就是说。它是一种酶,一种称为酪氨酸激酶的酶。因此,我们可以得出结论。该酶本质上是一种酪氨酸激酶。是多种激酶反应中的关键因子。这样,基于结构域。我们可以很容易预测。蛋白质的功能。按照惯例。
22:00
你可以保存这张图片,非常简单,这里有一个选项。点击后就可以保存图片。格式可以是SVG。也可以选择JPG格式。都很方便。以上就是smart的内容,它与PRO功能类似。但提供了更多信息。如架构。相互作用、通路、翻译后修饰、PTM和直系同源等。接下来我们看另一个数据库。Fame fame是最受研究人员欢迎的。数据库。但我建议你如果需要很好的。图形画展示可以使用inter PRO和smart,它们的图形效果非趁fame同样由mbo abbe维护。在fame页面。
23:01
输入可以是你的蛋白质ID或关键词。也可以是序列都可以作为输入我们。输入同一个序列开始检索。可以看到他同样提供。与inter PRO类似的结构域信息。也预测出5个结构域。并以图形方式展示。同时标出每个结构域的位置。并显示起始和结束的氨基酸位置。他还会。搜索结构域区域。点击后它会进行比对,显示比对区域。即你的序列与数据库中序列的比对。Fam.
24:00
基于隐马尔可夫模型HMM进行预测。我们知道。隐马尔可夫模型是一种统计模型,可用于描述可观测序列背后的演化过程。其中内部因素。是隐藏不可见的。Fame正式使用这种模型。来预测结构域。例如这里可以看到。HMM预测从第1位到第258位匹配了。数据库中已有的结构域。这是数据库中的已有信息。如果你点击这个蛋白质的结构域。他会为你提供。该结构域具体功能的信息。例如,该蛋白。
25:08
点击这里。Fame会显示它的具体功能。这是一个酪氨酸激酶蛋白。并给出相关的注释。数据库中有大量信息。如果你想查看每个细节。信息量非常大。关于该结构域有大量可用信息,点击其中一个结构域,它会显示大量信息,对你会很有帮助。如果你研究特定结构域。这会对你有帮助。帮助你了解。蛋白质的具体功能。好的。这3个数据库。对于研究。未知蛋白质的人来说至关重要。可以帮助你了解。蛋白质的功能综合这三个不同的注释。
26:01
数据库,他们会给出相似的结果。为你提供强有力的支持。帮助你确定。该蛋白质的具体功能。现在我们要看的是。另一项注释,如何确定跨膜区?如果你研究膜蛋白,这一点非常重要。它帮助我们理解蛋白质如何跨越。脂质双分子层。跨膜预测会给出跨膜区的位置和方向。可以看到有两个不同的工具。TMHMM和TMP服务器。它们是最常用的。
27:00
跨膜区预测服务器。基于自然界中已知的。跨膜蛋白数据进行预测。其中TMP使用。多个权重矩阵的组合进行评分。这种权重矩阵。评分方法用于评估。哪些区域会嵌入脂质双分子层?并显示哪些区域位于膜外。哪些区域位于膜内及?包治一侧的区域,这些信息至关重要。如果你研究。跨膜蛋白,它会告诉你配体legend。应该与受体结合,是在膜外还是在膜内?
28:04
我们先来看TMHMM服务器。我们需要提供。氨基酸序列。我将使用。5羟色胺受体25HT2。受体的序列,把序列粘贴到这里。点击提交。提交后。会在这里看到结果。首先显示氨基酸总数,该蛋白共471个氨基酸,你只需提供序列。
29:03
保持所有设置默认。如果需要在结果中显示图形,就保留这个选项,不需要图形的话。就选择无图形。在结果中,首先是氨基酸总数。还可以看到。预测结果。共有7条跨膜区被预测出来。可以看到这些区域。这里是第一、二、三、四、五、六七条跨膜区。这7条跨膜区中,这是膜外部分。及跨膜蛋白位于膜外的区域。这些是跨膜的脂质区域。嵌入膜内的部分。这一部分属于细胞内部。结果会显示。
30:00
各区域的位置可以看到。从第一位到第76位。氨基酸位于膜外。第77~99位氨基酸位于膜内,可以看到跨膜区为低100~102位,其间的环区位于膜内,在这两个跨膜区之间。D103~111位氨基酸位于分子内部。这样你就能轻松识别蛋白质中的跨膜区。除了这个工具。还有另一个数据库可用于。预测跨膜区叫做TMPD。这是TMPD的页面。它与之前的。数据库工具完全相同输入序列。
31:04
粘贴即可,非常简单。保持所有设置默认。点击运行。它会显示与之前相同的结果。可以看到,同样是7条。跨膜螺旋与之前位置相同。结果相同。可以看到跨膜区的位置和。膜内外的氨基酸区域长度也相同。他还提供了类似的信息。包括输水性图谱。这个输水性图谱。它会告诉你这里横轴代表。氨基酸,这里是0以上的区域。大于0表示。
32:02
蛋白质中输水的部分。低于0的是清水的部分。即蛋白质的清水部分。可以看到这里有1234567条。共期。调可能的跨膜区存在于该蛋白质中。通过这项分析。我们可以预测该蛋白有7条跨膜区。如果想保存这些信息。只需右键保存图片即可。这样。我们就能轻松用这种方法预测跨膜区。对比这两个工具,它们几乎完全相同。但TM pried会显示。输水性图谱,而之前的工具会显示。
33:03
直接的跨膜区示意图。音乐。
我来说两句