microsoft/foldingdiff

Diffusion models of protein structure; trigonometry and attention are all you need!

解決的問題

FoldingDiff 是設計用於生成新蛋白質骨架結構的模型。它解決了創造可用於蛋白質設計的新蛋白質形狀的挑戰,提供了一種在不需要預先存在的序列的情況下,採樣多樣且物理上合理的蛋白質摺疊的方法。

工作原理

本專案實作基於 BERT 架構的擴散模型。它在 CATH 蛋白質結構資料集上進行訓練,專門學習生成蛋白質骨架的內部角度。在取樣過程中,模型會逆向擴散過程,將雜訊「摺疊」成一個一致的蛋白質骨架。這些取樣的角度隨後轉換為笛卡兒座標,以產生 PDB 檔案。

適用對象

此工具適用於計算生物學與蛋白質工程領域的研究人員,他們希望生成新的蛋白質骨架,以進行後續的逆摺疊(設計適合結構的胺基酸序列)與結構預測。

主要亮點

  • 基於擴散的生成:使用擴散模型從雜訊生成新的蛋白質骨架。
  • 整合式評估:包含腳本,可使用 ProteinMPNN 和 ESM-IF1 等逆摺疊模型計算 TM 分數並評估「可設計性」。
  • 可視化功能:提供工具,使用 PyMOL 生成蛋白質摺疊過程的 GIF 動畫。
  • 預訓練權重:透過 HuggingFace 提供在 CATH 資料集上訓練的權重。

相關

  • 專案
  • 專案
  • 專案
  • 專案