Key points are not available for this paper at this time.
摘要 计算生物学和生物信息学提供了来自蛋白质序列的大量数据金矿,非常适合用于自然语言处理中的语言模型。这些语言模型以低推理成本追求新的预测前沿。在这里,我们在来自UniRef和BFD的数据上训练了两个自回归模型(Transformer-XL,XLNet)和四个自编码器模型(BERT,Albert,Electra,T5),数据中包含多达3930亿个氨基酸。使用5616个GPU和高达1024个核心的TPU Pod在Summit超级计算机上训练了这些语言模型。降维分析显示,从无标记数据中获得的原始蛋白质语言模型嵌入捕捉到了一些蛋白质序列的生物物理特征。我们验证了将这些嵌入作为后续几个任务的独占输入的优势。第一个任务是对蛋白质二级结构进行逐残基预测(3态准确率Q3=81%-87%);第二个任务是对蛋白质亚细胞定位进行逐蛋白预测(十态准确率:Q10=81%)以及膜与水溶性(2态准确率Q2=91%)。对于逐残基预测,信息最丰富的嵌入(ProtT5)首次超越了不使用进化信息的最新技术,从而避免了昂贵的数据库搜索。综合来看,这些结果暗示蛋白质语言模型学习了生命语言的一些语法。为了促进未来的工作,我们在https://github.com/agemagician/ProtTrans上发布了我们的模型。
A Sun,研究了这个问题。