首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >Nat. Commun. | 面向治疗性多肽性质预测的统一平台

Nat. Commun. | 面向治疗性多肽性质预测的统一平台

作者头像
DrugAI
发布2026-07-21 12:26:52
发布2026-07-21 12:26:52
340
举报

DRUGONE

治疗性多肽兼具小分子药物和抗体药物的优势,既具有较大的作用界面,又具有较低免疫原性,因此已成为近年来药物研发的重要方向。然而,多肽能否真正发展为药物,不仅取决于与靶标的结合能力,还受到膜渗透性、溶解性、稳定性、半衰期、毒性和溶血性等多种可开发性性质共同影响。随着环肽、D-氨基酸、多种化学修饰及非天然氨基酸不断应用于药物设计,现有预测工具通常只能处理天然氨基酸序列或单一性质,缺乏统一、多模态的评价平台。

研究人员提出PeptiVerse,一个统一的治疗性多肽性质预测平台。PeptiVerse能够同时接受氨基酸序列和SMILES表示的化学修饰多肽作为输入,整合蛋白质语言模型和化学语言模型,对结合亲和力、膜渗透性、溶血性、非污损性、溶解性、毒性和半衰期等多项关键性质进行统一预测。研究结果表明,PeptiVerse在多个公开基准上达到或超过现有最佳方法,并提供开放源码及网页平台,可直接服务于早期药物筛选和生成式多肽设计流程。

近年来,多肽药物快速发展,尤其是GLP-1受体激动剂等药物的成功,使治疗性多肽成为新药研发的重要方向。相比传统小分子,多肽能够识别更大的蛋白结合界面,可调控许多过去难以成药的蛋白–蛋白相互作用;相比抗体,多肽分子更小、制造成本更低、免疫原性更弱,因此具有广阔的临床应用前景。

然而,天然多肽通常存在多个限制。例如,膜渗透能力不足导致口服利用度较低,容易受到蛋白酶降解而半衰期较短,部分多肽溶解性差、易聚集,某些两亲性序列还可能引起溶血或非特异性蛋白吸附,从而影响体内疗效。因此,现代多肽药物设计越来越依赖环化、末端修饰、D-氨基酸替换以及非天然残基等策略改善药物性质。

这些化学修饰也带来了新的计算挑战。传统基于蛋白质序列的方法只能处理20种天然氨基酸,而许多化学修饰后的多肽只能采用SMILES表示。另一方面,目前已有工具通常针对单一性质开发,例如只预测渗透性或毒性,缺少统一平台综合评价多个性质,更无法同时支持天然序列与化学结构两种输入方式。

随着蛋白质语言模型和化学语言模型的发展,研究人员认为,可以利用预训练模型学习蛋白和分子表示,再结合轻量化预测器建立统一平台,实现多肽多属性预测,并进一步服务于生成式人工智能驱动的新药设计。

方法

研究人员构建PeptiVerse时,首先整合多个公开数据库,建立覆盖天然多肽和化学修饰多肽的统一数据集,包括溶血性、非污损性、毒性、溶解性、膜渗透性、结合亲和力以及半衰期等实验数据。天然序列采用ESM-2蛋白质语言模型获得表示,SMILES结构则利用PeptideCLM和ChemBERTa学习化学表示。针对不同性质,分别比较支持向量机、Elastic Net、XGBoost、多层感知机、卷积神经网络和Transformer等多种预测器,通过Optuna自动优化超参数,并为每一种性质选择性能最佳模型。对于结合亲和力预测,则采用跨注意力Transformer同时融合蛋白序列和多肽表示,实现蛋白–多肽联合建模。最终所有模型统一部署于PeptiVerse网页平台,实现序列和SMILES双输入、多性质统一预测。

结果

PeptiVerse建立统一的多肽性质预测框架

研究人员首先建立PeptiVerse整体框架,将不同来源的数据统一整理为标准化数据集。整个平台覆盖天然多肽和非天然多肽两类表示方式,可同时支持氨基酸序列和SMILES输入。

数据分析发现,不同性质之间的数据规模差异十分明显。溶血性、非污损性和溶解性均拥有数千甚至上万条实验样本,因此能够支持稳定训练;相比之下,半衰期和结合亲和力实验数据规模较小,实验条件也更加复杂,因此预测难度明显更高。

研究人员指出,当前多肽性质预测的主要瓶颈并非模型能力,而是实验数据数量和质量。因此,不同性质需要采用不同建模策略,而不能简单使用统一模型解决所有任务。

图1:PeptiVerse整体框架,包括数据整理、序列和SMILES双输入、不同预测模型及生成式设计应用流程。

多种性质预测达到先进水平

研究人员随后比较多种预测模型在不同性质上的表现。结果显示,当采用预训练语言模型获得高质量表示后,不同机器学习模型之间性能差异已经明显缩小。对于大多数性质,支持向量机、卷积神经网络、Transformer以及XGBoost均能够取得相近结果。这说明真正决定预测性能的是底层表示,而不是后续分类器复杂程度。

进一步分析发现,不同性质对应最佳模型并不相同。例如,溶血性更适合支持向量机,溶解性更适合卷积网络,而部分SMILES任务则更加适合Transformer。因此,PeptiVerse并未采用统一网络,而是针对每项性质自动选择最佳模型。

研究人员还比较了不同基础表示模型。总体而言,蛋白质语言模型ESM-2能够稳定获得最佳序列表示,而ChemBERTa在化学修饰多肽渗透性预测中表现优于PeptideCLM。这表明,不同性质需要结合不同基础模型优势。

在所有评价任务中,膜渗透性预测表现最好,其中天然多肽细胞穿透能力预测F1达到0.929;溶解性预测达到0.744;多项SMILES预测同样取得较高准确率。

图2:不同多肽性质的数据分布,包括分类任务和回归任务训练集与验证集统计。

结合亲和力预测优于结构置信度指标

近年来,AlphaFold3等结构预测模型逐渐用于蛋白–多肽复合物预测,因此研究人员进一步比较结构预测置信度是否能够反映真实结合能力。

首先,研究人员利用OpenFold3预测蛋白–多肽复合物,并计算ipTM结构置信度。结果发现,无论天然多肽还是化学修饰多肽,ipTM与真实结合亲和力几乎没有相关性,说明结构预测可信度不能直接反映结合强度。

相比之下,PeptiVerse采用跨注意力Transformer直接学习蛋白和多肽之间的相互作用,在天然多肽数据集上达到约0.57的Spearman相关系数,在SMILES多肽上达到约0.61,均明显优于单纯依赖结构置信度的方法。

研究人员认为,造成这一现象的重要原因在于,多肽结合通常涉及柔性构象变化、浅表结合界面以及复杂化学修饰,仅依赖结构预测难以准确刻画结合自由能,而数据驱动方法能够更直接学习实验规律。

图3:PeptiVerse结合亲和力预测性能,与结构预测置信度以及现有方法的比较结果。

建立统一网页平台支持多肽设计

为了方便实验研究人员使用,研究人员进一步开发PeptiVerse在线平台,并部署于HuggingFace。

用户可以直接输入天然多肽序列或SMILES表示的化学修饰多肽,同时输入目标蛋白序列,即可快速获得多个性质预测结果,包括结合亲和力、溶解性、膜渗透性、溶血性、非污损性、毒性和半衰期等指标。

平台同时计算分子量、电荷、等电点及疏水性等基本理化性质,并展示训练数据分布,使用户能够判断待测多肽是否位于模型适用范围内。

研究人员进一步比较PeptiVerse与PeptideBERT、PepLand等已有工具。总体来看,PeptiVerse不仅覆盖更多性质,而且首次同时支持天然序列和SMILES两种输入形式。虽然PepLand在部分随机划分数据集上取得较高结果,但研究人员采用更加严格的相似性划分方式,使训练集和测试集保持较低相似性,因此更加真实反映模型对未知多肽的泛化能力。

此外,由于PeptiVerse全部采用轻量化预测头,其计算成本远低于重新训练大型语言模型,更适合集成到生成式多肽设计流程,实现候选序列实时评分和筛选。

图4:PeptiVerse在线平台界面,包括序列和SMILES输入、多性质预测及结果展示页面。

讨论

研究人员提出的PeptiVerse首次建立了覆盖天然多肽和化学修饰多肽的统一性质预测平台,实现序列和SMILES双模态输入,并同时预测结合亲和力、膜渗透性、毒性、溶解性、溶血性、半衰期等多个关键开发性质。

研究结果表明,当利用高质量蛋白质语言模型和化学语言模型获得表示后,下游预测器并不需要十分复杂,轻量化机器学习模型即可达到先进性能。这种设计不仅降低训练成本,而且更加容易扩展到新的性质预测任务。

PeptiVerse特别强调统一评价的重要性。过去研究通常分别建立多个独立模型,而PeptiVerse将不同性质纳入同一平台,使研究人员能够在早期设计阶段综合评价多个开发指标,而不仅关注结合能力。这对于多目标优化尤为重要,因为真正能够进入临床开发的多肽通常需要同时兼顾活性、稳定性、安全性和可制造性。

研究人员还指出,目前部分性质仍受到实验数据不足限制,例如半衰期和结合亲和力数据规模远小于分类任务,因此预测性能仍有提升空间。未来随着更多实验数据公开,以及更新一代蛋白质和化学基础模型不断出现,PeptiVerse可以直接替换底层表示模型,而无需重新设计整个预测框架。

总体而言,PeptiVerse不仅是一个统一的多肽性质预测平台,更是生成式多肽设计的重要评价模块。未来结合扩散模型、流匹配模型以及强化学习等生成方法,PeptiVerse有望作为多目标奖励函数,实现多肽序列生成、候选筛选和性质优化的一体化闭环,加速新一代治疗性多肽药物的智能研发。

整理 | DrugOne团队

参考资料

Zhang, Y., Tang, S., Chen, T. et al. PeptiVerse: A unified platform for therapeutic peptide property prediction. Nat Commun (2026).

https://doi.org/10.1038/s41467-026-74167-w

内容为【DrugOne】公众号原创|转载请注明来源

本文参与 腾讯云自媒体同步曝光计划,分享自微信公众号。
原始发表:2026-07-19,如有侵权请联系 cloudcommunity@tencent.com 删除

本文分享自 DrugOne 微信公众号,前往查看

如有侵权,请联系 cloudcommunity@tencent.com 删除。

本文参与 腾讯云自媒体同步曝光计划  ,欢迎热爱写作的你一起参与!

评论
登录后参与评论
0 条评论
热度
最新
推荐阅读
领券
问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档