plinder-org/plinder

Protein Ligand INteraction Dataset and Evaluation Resource

解决的问题

PLINDER 解决了训练和评估蛋白质-配体对接算法对高质量、带注释数据集的需求。它提供了一个标准化资源,使结构生物学能够超越简单的记忆,通过精心策划的划分来最小化信息泄露,并支持现实的推理场景,如命中发现和优化。

如何工作

PLINDER 将超过 40 万个蛋白质-配体相互作用(PLI)系统的大规模数据集与一个与蛋白质数据库(PDB)同步的自动化注释管道相结合。每个系统提供超过 750 个注释,包括蛋白质和配体的属性以及相似性评分。该资源包含一个 Python 包(plinder.core),便于与数据交互,以及一个数据生成包(plinder.data)。它还链接了未结合(apo)结构和预测的 AlphaFold2 结构与其对应的全结合(holo)系统,帮助模型处理现实的结构变异。

适用对象

该资源专为从事结构生物学机器学习的研究人员和开发者设计,特别是那些构建蛋白质-配体对接模型、共折叠算法或生成新型配体结构工具的人。

主要亮点

  • 大规模:涵盖 11,000 个 SCOP 结构域和 50,000 个独特小分子的超过 40 万个 PLI 系统。
  • 稳健的基准测试:提供按新配体、新口袋或新蛋白质分层的精心策划的训练-验证-测试划分,防止数据泄露。
  • 全面的注释:每个系统提供 750 多个注释和 14 种不同的 PLI 指标。
  • 集成结构:将实验性 apo 结构和 AlphaFold2 预测结构与对应的 holo 系统关联。
  • 评估框架:提供专用框架,简化并标准化不同模型之间的性能比较。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目