MLCIL/scikit-fingerprints

Scikit-learn compatible library for molecular fingerprints and chemoinformatics

解決的問題

簡化將化學結構(SMILES 字串)轉換為機器學習模型可理解的數值格式的流程,進而支援建立生產級的化學資訊學機器學習流程。

如何運作

該套件提供統一的 .transform() API,用於計算各種分子指紋、過濾器與距離度量。它原生整合於 scikit-learn,讓使用者可直接將分子特徵萃取嵌入 PipelineFeatureUnion 物件中。它利用 C++ RDKit 提升效率,並支援平行化與稀疏矩陣。

適用對象

從事分子性質預測、藥物發掘或化學資料集分析的化學資訊學家、藥物化學家與機器學習工程師。

主要特色

  • 廣泛的指紋庫:支援超過 30 種類型,包括 ECFP、Avalon、MACCS、Mordred 與 PubChem,以及來自預訓練網路的神經指紋。
  • 分子分析工具:包含超過 30 個分子過濾器(例如 Lipinski 的 5 規則)與 14 種相似度/距離度量(例如 Tanimoto)。
  • 可靠性檢查:提供 11 種適用域方法,用以評估新分子是否落在訓練模型的可靠範圍內。
  • 內建基準測試:整合存取 MoleculeNet 與 Therapeutics Data Commons 等主要資料集,並提供預先定義的訓練-測試分割。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案