microsoft/foldingdiff

Diffusion models of protein structure; trigonometry and attention are all you need!

解决的问题

FoldingDiff 旨在生成新颖的蛋白质骨架结构。它解决了创建可用于蛋白质设计的新蛋白质形状的挑战,提供了一种无需预先存在的序列即可采样多样且物理上合理的蛋白质折叠的方法。

工作原理

该项目实现了基于 BERT 架构的扩散模型。它在 CATH 蛋白质结构数据集上进行训练,专门学习生成蛋白质骨架的内部角度。在采样过程中,模型会逆转扩散过程,将噪声“折叠”成一个连贯的蛋白质骨架。这些采样的角度随后被转换为笛卡尔坐标,以生成 PDB 文件。

适用人群

本工具适用于计算生物学和蛋白质工程领域的研究人员,他们希望生成新的蛋白质骨架,用于后续的逆折叠(设计适配结构的氨基酸序列)和结构预测。

主要亮点

  • 基于扩散的生成:使用扩散模型从噪声中生成新的蛋白质骨架。
  • 集成评估:包含脚本,可使用 ProteinMPNN 和 ESM-IF1 等逆折叠模型计算 TM 分数并评估“可设计性”。
  • 可视化功能:提供工具,使用 PyMOL 生成蛋白质折叠过程的 GIF 动画。
  • 预训练权重:通过 HuggingFace 提供在 CATH 数据集上训练的权重。

相关

  • 项目
  • 项目
  • 项目
  • 项目