MLCIL/scikit-fingerprints

Scikit-learn compatible library for molecular fingerprints and chemoinformatics

解决的问题

简化将化学结构(SMILES 字符串)转换为机器学习模型可理解的数值格式的过程,从而支持构建生产级别的化学信息学机器学习流水线。

工作原理

该库提供统一的 .transform() API,用于计算各种分子指纹、过滤器和距离度量。它原生集成于 scikit-learn,允许用户将分子特征提取直接嵌入到 PipelineFeatureUnion 对象中。它利用 C++ RDKit 实现高效计算,并支持并行化和稀疏矩阵。

适用人群

从事分子性质预测、药物发现或化学数据集分析的化学信息学家、药物化学家和机器学习工程师。

主要亮点

  • 丰富的指纹库:支持超过 30 种类型,包括 ECFP、Avalon、MACCS、Mordred 和 PubChem,以及来自预训练网络的神经指纹。
  • 分子分析工具:包含超过 30 个分子过滤器(如 Lipinski 的 5 规则)和 14 种相似度/距离度量(如 Tanimoto)。
  • 可靠性检查:提供 11 种适用域方法,用于评估新分子是否在训练模型的可靠范围内。
  • 内置基准测试:集成访问 MoleculeNet 和 Therapeutics Data Commons 等主要数据集,并提供预定义的训练-测试划分。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目