feature-engine/feature_engine
Feature engineering and selection open-source Python library compatible with sklearn.
解决的问题
Feature-engine 提供了一套全面的工具,用于为机器学习模型进行特征工程和特征选择,简化了将原始数据准备为模型训练格式的过程。它解决了将原始变量转换为能提升模型性能的格式的挑战,并处理了缺失值、异常值和类别数据等常见数据问题。
工作原理
该库由多个遵循 Scikit-learn API 的转换器组成,使用 fit() 和 transform() 方法。这使得库能够从训练数据中学习转换参数,并在训练集和测试集上一致地应用相同的转换。
适用人群
专为使用 Python 和 Scikit-learn 构建预测模型,并需要一种稳健方法来处理特征工程和特征选择的数据科学家和机器学习工程师设计。
主要亮点
- 丰富的缺失值处理:提供多种处理缺失数据的方法,如均值、中位数和随机样本插补。
- 类别编码:支持多种编码技术,包括独热编码(One-Hot)、序数编码和证据权重(WoE)编码。
- 特征选择:提供工具用于删除相关特征、移除常量特征,以及使用递归特征消除(RFE)。
- 多样化的转换:支持变量缩放、离散化,以及针对日期时间、文本和时间序列数据的特定转换。
- 与 Scikit-learn 完全集成:与 Scikit-learn 管道完全兼容,可轻松集成到现有的机器学习工作流中。
相关
- 项目
- 项目
- 项目
- 项目
- 项目