MLCIL/scikit-fingerprints
Scikit-learn compatible library for molecular fingerprints and chemoinformatics
해결하는 문제
화학 구조(SMILES 문자열)를 머신러닝 모델이 이해할 수 있는 수치 형식으로 변환하는 과정을 단순화하여, 프로덕션 수준의 화학정보학 ML 파이프라인을 구축할 수 있도록 합니다.
작동 방식
이 라이브러리는 다양한 분자 핀거프린트, 필터, 거리 측정을 계산하기 위한 통일된 .transform() API를 제공합니다. scikit-learn에 내장된 통합을 통해 사용자는 분자 특징 추출을 Pipeline 및 FeatureUnion 객체에 직접 포함시킬 수 있습니다. C++ RDKit을 활용하여 효율성을 확보하고, 병렬 처리 및 희소 행렬을 지원합니다.
대상 사용자
분자 성질 예측, 약물 발견, 화학 데이터셋 분석에 종사하는 화학정보학자, 의약화학자, ML 엔지니어.
주요 특징
- 풍부한 핀거프린트 라이브러리: ECFP, Avalon, MACCS, Mordred, PubChem 등 30종 이상을 지원하며, 사전 학습된 네트워크에서 얻은 신경망 핀거프린트도 포함됩니다.
- 분자 분석 도구: Lipinski의 5칙 등 30개 이상의 분자 필터와 Tanimoto 등 14개 이상의 유사도/거리 측정 기능을 포함합니다.
- 신뢰성 검사: 훈련된 모델의 신뢰 가능한 범위 내에 새로운 분자가 포함되는지 평가할 수 있는 11가지 적용 영역 방법을 제공합니다.
- 내장된 벤치마크: MoleculeNet 및 Therapeutics Data Commons와 같은 주요 데이터셋에 통합 접근이 가능하며, 사전 정의된 학습-테스트 분할을 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트