plinder-org/plinder
Protein Ligand INteraction Dataset and Evaluation Resource
해결하는 문제
PLINDER는 단백질-리간드 도킹 알고리즘을 훈련하고 평가하기 위해 고품질의 주석이 달린 데이터셋이 필요하다는 문제를 해결합니다. 단순한 기억에 그치지 않고 구조 생물학의 발전을 가능하게 하기 위해 정보 유출을 최소화하는 정제된 분할을 제공하며, 히트 발견 및 최적화와 같은 현실적인 추론 시나리오를 지원합니다.
작동 방식
PLINDER는 40만 개 이상의 단백질-리간드 상호작용(PLI) 시스템과 단백질 데이터베이스(PDB)와 동기화되는 자동 정제 파이프라인을 결합합니다. 각 시스템에 대해 단백질 및 리간드 특성과 유사도 점수를 포함한 750개 이상의 주석을 제공합니다. 데이터 접근을 용이하게 하기 위해 Python 패키지(plinder.core)와 데이터 생성 패키지(plinder.data)를 제공합니다. 또한, 비결합(아포) 구조와 예측된 AlphaFold2 구조를 해당 홀로 구조에 연결하여 모델이 현실적인 구조적 변이를 처리할 수 있도록 지원합니다.
대상 사용자
이 리소스는 기계 학습을 활용한 구조 생물학 연구 및 개발에 종사하는 연구자 및 개발자, 특히 단백질-리간드 도킹 모델, 공폴딩 알고리즘, 또는 새로운 리간드 구조를 생성하는 도구를 개발하는 사람들을 위한 것입니다.
주요 특징
- 대규모 규모: 11,000개 이상의 SCOP 도메인과 50,000개 이상의 고유한 소분자를 포함한 40만 개 이상의 PLI 시스템.
- 강력한 벤치마킹: 새로운 리간드, 포켓, 단백질 기준으로 계층화된 정제된 학습-검증-테스트 분할을 제공하여 데이터 유출을 방지.
- 포괄적인 주석: 시스템당 750개 이상의 주석과 14가지의 다양한 PLI 메트릭스.
- 통합된 구조: 실험적 아포 구조와 AlphaFold2 예측 구조를 홀로 시스템에 연결.
- 평가 하네스: 다양한 모델 간 성능 비교를 간소화하고 표준화하는 전용 프레임워크 제공.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트