plinder-org/plinder
Protein Ligand INteraction Dataset and Evaluation Resource
解決的問題
PLINDER 解決了訓練與評估蛋白質-配體對接演算法對高品質、帶註解資料集的需求。它提供一個標準化資源,使結構生物學能超越簡單記憶,透過精心策劃的分割來最小化資訊洩漏,並支援現實的推論情境,例如命中發現與優化。
如何運作
PLINDER 將超過 40 萬個蛋白質-配體相互作用(PLI)系統的大規模資料集,與一個與蛋白質資料庫(PDB)同步的自動化註解流程結合。每個系統提供超過 750 個註解,包括蛋白質與配體的特性以及相似性分數。該資源包含一個 Python 套件(plinder.core),方便與資料互動,以及一個資料產生套件(plinder.data)。它還連結未結合(apo)結構與預測的 AlphaFold2 結構至其對應的全結合(holo)系統,協助模型處理現實的結構變異。
適用對象
此資源專為從事結構生物學機器學習的研究人員與開發者設計,特別是那些建構蛋白質-配體對接模型、共摺疊演算法或生成新配體結構工具的人。
主要亮點
- 大規模:涵蓋 11,000 個 SCOP 結構域與 50,000 個獨特小分子的超過 40 萬個 PLI 系統。
- 穩健的基準測試:提供按新配體、新口袋或新蛋白質分層的精心策劃的訓練-驗證-測試分割,防止資料洩漏。
- 全面的註解:每個系統提供 750 多個註解與 14 種不同的 PLI 指標。
- 整合結構:將實驗性 apo 結構與 AlphaFold2 預測結構連結至對應的 holo 系統。
- 評估工具:提供專用框架,簡化並標準化不同模型之間的效能比較。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案