plinder-org/plinder

Protein Ligand INteraction Dataset and Evaluation Resource

何を解決するか

PLINDERは、タンパク質-リガンドドッキングアルゴリズムの学習と評価に必要な高品質で注釈付きデータセットの必要性に対応しています。構造生物学における単純な記憶にとどまらない進展を可能にするために、情報漏洩を最小限に抑えるカスタマイズされた分割を提供し、ヒット発見や最適化といった現実的な推論シナリオをサポートします。

仕組み

PLINDERは40万件以上のタンパク質-リガンド相互作用(PLI)システムからなる大規模データセットと、Protein Data Bank(PDB)と同期する自動カスタマイズパイプラインを組み合わせています。各システムに対して750以上の注釈(タンパク質およびリガンドの特性、類似度スコアなど)を提供しています。Pythonパッケージ(plinder.core)を用いてデータに簡単にアクセスでき、データ生成用パッケージ(plinder.data)も提供しています。また、未結合(アポ)構造および予測されたAlphaFold2構造を、対応するホロ構造にリンクすることで、モデルが現実的な構造変化を処理できるように支援します。

対象ユーザー

このリソースは、機械学習を用いた構造生物学の研究者および開発者、特にタンパク質-リガンドドッキングモデル、共フォールディングアルゴリズム、または新しいリガンド構造を生成するツールを開発している人向けです。

主な特徴

  • 大規模スケール:11,000以上のSCOPドメインと50,000以上の固有の小分子をカバーする40万件以上のPLIシステム。
  • 堅牢なベンチマーク:新しいリガンド、ポケット、タンパク質に基づいて層別化されたカスタマイズされた訓練・検証・テスト分割を提供し、データ漏洩を防止。
  • 包括的な注釈:1システムあたり750以上の注釈と、14種類の異なるPLIメトリクス。
  • 統合された構造データ:実験的アポ構造とAlphaFold2予測構造をホロ構造にリンク。
  • 評価ハーネス:異なるモデル間の性能比較を簡素化・標準化する専用フレームワークを提供。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト