online-ml/river

🌊 Online machine learning in Python

解决的问题

River 解决了在流式数据上训练机器学习模型的问题。与在固定数据集上训练模型的传统批量学习不同,River 允许模型逐个从新数据点中学习,消除了重新访问过去数据的需求,并使系统对概念漂移(随时间变化的底层数据分布变化)具有鲁棒性。

工作原理

River 实现了一个流式接口,其中预测和模型更新是顺序进行的。它提供了 learn_onepredict_one 模式,允许模型一次处理单个样本。对于需要的人,它还通过 pandas 支持可选的微批处理接口(learn_manypredict_many)。

适用对象

专为需要为基于事件的生产环境构建模型的开发人员和数据科学家,以及处理随时间演变的数据的人士而设计。

亮点

  • 多样化的算法套件:包括线性模型、决策树、随机森林、异常检测、漂移检测和推荐系统。
  • Creme 与 Scikit-Multiflow 合并:结合了两个成熟的在线机器学习库的功能。
  • 全面的工具集:提供在线统计、预处理、特征提取和渐进式模型验证。
  • 用户友好的 API:专注于清晰度和易用性,与 Python 生态系统无缝集成。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目