MLCIL/scikit-fingerprints
Scikit-learn compatible library for molecular fingerprints and chemoinformatics
解決的問題
簡化將化學結構(SMILES 字串)轉換為機器學習模型可理解的數值格式的流程,進而支援建立生產級的化學資訊學機器學習流程。
如何運作
該套件提供統一的 .transform() API,用於計算各種分子指紋、過濾器與距離度量。它原生整合於 scikit-learn,讓使用者可直接將分子特徵萃取嵌入 Pipeline 與 FeatureUnion 物件中。它利用 C++ RDKit 提升效率,並支援平行化與稀疏矩陣。
適用對象
從事分子性質預測、藥物發掘或化學資料集分析的化學資訊學家、藥物化學家與機器學習工程師。
主要特色
- 廣泛的指紋庫:支援超過 30 種類型,包括 ECFP、Avalon、MACCS、Mordred 與 PubChem,以及來自預訓練網路的神經指紋。
- 分子分析工具:包含超過 30 個分子過濾器(例如 Lipinski 的 5 規則)與 14 種相似度/距離度量(例如 Tanimoto)。
- 可靠性檢查:提供 11 種適用域方法,用以評估新分子是否落在訓練模型的可靠範圍內。
- 內建基準測試:整合存取 MoleculeNet 與 Therapeutics Data Commons 等主要資料集,並提供預先定義的訓練-測試分割。
相關
- 專案
- 專案
- 專案
- 專案
- 專案