Redian新闻
>
单模型斩获「蛋白质突变预测」榜一!西湖大学提出基于结构词表方法 | ICLR 2024 Spotlight

单模型斩获「蛋白质突变预测」榜一!西湖大学提出基于结构词表方法 | ICLR 2024 Spotlight

公众号新闻



  新智元报道  

编辑:LRS
【新智元导读】Saprot在proteingym蛋白质突变预测任务公开基准榜(由牛津大学计算机与哈佛医学院设立)排名第一。相比,其他排名靠前的算法都是混合模型,专门针对突变任务设计,而Saprot不仅是单模型,而且是通用模型。


蛋白质结构相比于序列往往被认为更加具有信息量,因为其直接决定了蛋白质的功能。


而随着AlphaFold2带来的巨大突破,大量的预测结构被发布出来供人研究使用,如何利用这些蛋白质结构来训练强大且通用的表征模型是一个值得研究的方向。


西湖大学的研究人员利用Foldseek来处理蛋白质结构,将其编码成一维的离散token,并与传统的氨基酸进行结合,形成了结构感知词表(Structure-aware Vocabulary),以此将结构信息嵌入到模型输入中,增强模型的表征能力。


论文地址:https://www.biorxiv.org/content/10.1101/2023.10.01.560349v4

Github地址:https://github.com/westlake-repl/SaProt


在预训练上,本文使用了目前最多的蛋白质结构(大约4000万),在64张A100上训练了3个月,最终开源了具备650M参数量的模型SaProt(同时包括了35M的版本)。实验结果表明SaProt各种蛋白质任务上都要好于之前的序列和结构模型。


ProteinGym:https://proteingym.org/benchmarks



方法


该研究利用Foldseek将蛋白质进行编码,生成了一维的3Di结构序列(使用了Foldseek的结构词表,每种3Di token代表不同的局部结构),这样的结构序列与氨基酸序列是等长的。



因此研究人员使用了一种简单而有效的结构嵌入方式:将结构词表和氨基酸词表计算笛卡尔积(即两两组合),形成新的结构感知词表。


这样对于蛋白质的每个位点,其氨基酸类型和对应的局部结构都能组合成新词表中的某个元素,从而让模型同时考虑到蛋白质的序列与结构信息。


本文使用Bert架构进行掩码语言建模(Masked Language Modeling )预训练(关于训练的更多细节请参考原论文)。


结构感知词表


实验


方法对比


一个可能令人疑惑的问题就是为什么需要这样编码结构?论文展示了使用不同的结构编码方式进行预训练的结果图:

不同结构模型训练的loss曲线图


图左和图中是两种经典的蛋白质结构建模方式,即将结构信息编码成bias后添加到transformer的attention map中(如Evoformer,Uni-Mol),或者使用图神经网络的方式建模蛋白质的空间关系(如MIF,GearNet等)。


然而从loss图中可以发现,当上述两种建模方式在AF2结构上使用MLM的训练目标进行预训练时,模型会非常迅速地过拟合(表现为在AF2预测结构上预测loss非常低,但在PDB真实结构上loss停滞甚至上升)。


作者推测这是由于AF2预测出来的蛋白质结构带有一些隐藏的模式(patterns),由于前两种方式是直接对蛋白质的三维坐标进行建模,这些隐藏的pattern可能很轻易地就被模型识别出来,从而造成了信息泄露的问题,让模型无需真正学习到蛋白质的进化信息就能轻松地完成训练目标。


而结构感知词表通过将蛋白质结构编码成一维的结构序列,在尽可能保留结构模式的情况下忽略了精细的坐标数值,因此模型能够有效地利用结构信息而不受到隐藏pattern的影响。


Zero-shot测试


作者在蛋白质突变数据集(ProteinGym)上和真实人类临床疾病数据集(ClinVar)上测试了SaProt的zero-shot能力,结果如下:


Zero-shot实验结果


SaProt在两个数据集上都超越了以往的所有结构和序列模型,证明了其在zero-shot预测突变上具备优异的能力。


监督微调测试


本文还涵盖了各种下游任务来测试模型表现,结果如下:

下游任务fine-tune结果


SaProt在各个下游任务上都超越了以往的序列和结构模型,展示出了其强大且通用的表征能力。


结构信息测试


SaProt在4000万的蛋白质结构上进行训练,获得了强大的表征能力。一个可能的疑问是如何确定SaProt学到了更多的结构信息而不是模型被训练得更好?论文对SaProt和ESM-2在残基接触预测任务(Contact Prediction Task)上进行了测试。作者冻住了模型的backbone,只训练一个线性分类层。


实验结果如下:

Contact Prediction Task的结果


从结果可以看到,由于结构token的嵌入,SaProt的表现大大超越了ESM-2,这表明SaProt蕴含了非常丰富的结构信息,使其能够在结构预测任务上获得十分优异的结果。


同时,论文在SCOPe数据库上对alpha蛋白质和beta蛋白质进行了可视化,结果如下:


在SCOPe数据库上的Embedding可视化


SaProt的可视化结果非常清晰地将alpha蛋白质和beta蛋白质区分开来,而ESM-2的可视化结果却将两种蛋白质混杂在一起,这说明了SaProt对结构的变化有很强的感知能力。


不同结构预测方法的比较


除了AF2,目前还存在许多其他的单序列结构预测方法(如ESMFold),因此本文额外测试了其他方法预测出来的结构对SaProt性能的作用。


结果如下:

不同结构预测方法的fine-tune结果


从测试结果可以看出,虽然SaProt在AF2结构上的表现最好(模型本身也是基于AF2结构进行训练的),但其他的结构预测方法也能让SaProt与ESM-2等模型性能相当。


这意味着考虑到计算与时间成本,单序列结构预测模型也能作为替代方法输入到SaProt中。


局限


虽然SaProt经过训练展示出了优异的性能,但依然还有一些可以改进的地方,例如:


1. Foldseek默认的结构词表大小只有20,如果有更加精准的结构编码模型,扩大结构表征的词表大小,是不是能进一步提升模型利用结构的能力?


2. 由于计算能力的限制,SaProt只在650M上完成了训练。如果能够继续扩大模型规模,是否可以进一步地提升模型表现?


3. 论文虽然已经测试了很多的蛋白质任务,但还有一些其他任务可以应用探索,例如蛋白质序列设计(给定backbone预测氨基酸序列)等。


参考资料:
https://www.biorxiv.org/content/10.1101/2023.10.01.560349v4




微信扫码关注该文公众号作者

戳这里提交新闻线索和高质量文章给我们。
相关阅读
ECCV 2024|有效提高盲视频去闪烁效果,美图公司&国科大提出基于 STE 新方法 BlazeBVDICLR 2024 | 冻结住的CLIP仍可作为教师模型!港大提出全新开集动作识别模型4000万蛋白结构训练,西湖大学开发基于结构词表的蛋白质通用大模型,已开源今日arXiv最热NLP大模型论文:揭露大语言模型短板,北京大学提出事件推理测试基准《巴郞笔谈》008:水火饮食Meta 联合纽约大学和华盛顿大学提出MetaCLIP,带你揭开CLIP的高质量数据之谜。ICML 2024 Spotlight | 在解码中重新对齐,让语言模型更少幻觉、更符合人类偏好春季观鹤:2024 科州深度解析RAG大模型知识冲突,清华西湖大学港中文联合发布西湖大学提出AIGC检测框架,精准识别AI撰写的文稿ICLR 2024 | 跨领域准确进行零样本异常检测,浙大等提出AnomalyCLIP饶毅:国内引进的一批国际正教授几乎被“清零”!西湖大学国际正教授已超北大清华,除浙大外,大部分国内大学都接近放弃招聘国际正教授ICML 2024 | 提升收敛速度!人大提出基于镜像下降的贝叶斯小样本分类Meta联合纽约大学和华盛顿大学提出MetaCLIP,带你揭开CLIP的高质量数据之谜中国科学技术大学、西湖大学、香港大学、南京大学等知名学者重磅来袭!不影响输出质量还能追踪溯源,「大模型无偏水印」入选ICLR 2024 Spotlight美股基本面 - 2024_03_24 * 晨报 * 美联储助攻点燃资金狂热,美股能否开启新行情。多家航司莫斯科线免费退改签 莫2024,哪个包会是LV的断货王?今日arXiv最热大模型论文:复旦提出基于diffusion的虚拟试衣模型,模特一键换装KNAW/上海交通大学/中国科学院大学/康奈尔大学/西湖大学/小红书|海内外心理学相关RA&工作今日arXiv最热NLP大模型论文:对指令太敏感?山东大学提出一致性对齐法,治好大模型敏感体质!Spotlight消费满$120,减$40!回国杂记(2308)好人一生平安美女,老啦!填补AlphaFold3空白,字节跳动提出物理引导的方法让蛋白质动起来Best CD Rates Of April 2024: Up To 5.42%低调又迷人,它完成了DNA和蛋白质都无法做到的事 | 西湖大学付向东教授对谈《环球科学》花飘落比LERF提速199倍!清华哈佛发布LangSplat:三维语义高斯泼溅 | CVPR 2024 Highlight上海交通大学/中国科学院大学/康奈尔大学/西湖大学/小红书/简单心理/Knowyourself|海内外心理学相关RA&工作【西湖村房产】南加州Westlake Village西湖村5卧独栋别墅【2024.07.18】愚人节(4/1/2024)彻底根除“论文工厂”的方法,只会是“更简单的论文发表方式”;文献计量分析,让医生彻底解脱开发论文的桎梏!30倍于传统方法,中国科学院团队Transformer深度学习模型预测糖-蛋白质作用位点有不烦车子的自动停启功能的吗?2024 BMW X5ICLR 2024 Oral | 应对随时间变化的分布偏移,西安大略大学等提出学习时序轨迹方法ACL2024:浙江大学提出大小模型协同的跨文档理解,低成本高表现ICLR 2024 Spotlight | 无惧中间步骤,MUSTARD可生成高质量数学推理数据清华大学联合斯坦福大学提出混合注意力机制MoA,大模型解码速率提高6倍湖南大学聂舟团队Angew |工程化Anti-CRISPR蛋白创建CRISPR-Cas蛋白开关用于激活型基因编辑和病毒蛋白酶检测
logo
联系我们隐私协议©2024 redian.news
Redian新闻
Redian.news刊载任何文章,不代表同意其说法或描述,仅为提供更多信息,也不构成任何建议。文章信息的合法性及真实性由其作者负责,与Redian.news及其运营公司无关。欢迎投稿,如发现稿件侵权,或作者不愿在本网发表文章,请版权拥有者通知本网处理。