microsoft/foldingdiff

Diffusion models of protein structure; trigonometry and attention are all you need!

何を解決するか

FoldingDiffは、新しいタンパク質の骨格構造を生成するように設計されています。既存の配列がなくても、多様で物理的に妥当なタンパク質の折りたたみ構造をサンプリングできる方法を提供し、タンパク質設計に使用可能な新しいタンパク質の形状を作成する課題に対処しています。

動作方法

このプロジェクトはBERTアーキテクチャに基づく拡散モデルを実装しています。CATHタンパク質構造データセット上で訓練されており、タンパク質骨格の内部角度を生成するように学習しています。サンプリングプロセスでは、拡散プロセスを逆にすることで、ノイズから一貫したタンパク質骨格へと「折りたたみ」を行います。これらのサンプリングされた角度は、その後カルテシアン座標に変換され、PDBファイルが生成されます。

対象ユーザー

計算生物学およびタンパク質工学の研究者が、その後の逆折りたたみ(構造に適合するアミノ酸配列の設計)や構造予測に使用できる新しいタンパク質骨格を生成したい場合に適しています。

特徴

  • 拡散ベースの生成: ノイズから新しいタンパク質骨格を生成する拡散モデルを使用。
  • 統合された評価: ProteinMPNNやESM-IF1などの逆折りたたみモデルを用いてTMスコアの計算と「設計可能性」の評価を行うスクリプトを含む。
  • 可視化機能: PyMOLを用いてタンパク質の折りたたみプロセスのGIFを生成するツールを提供。
  • 事前学習済み重み: HuggingFace経由でCATHデータセット上で訓練された重みを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト