online-ml/river

🌊 Online machine learning in Python

解決する課題

Riverは、ストリーミングデータ上での機械学習モデルのトレーニングに関する問題を解決します。モデルを固定されたデータセットでトレーニングする従来のバッチ学習とは異なり、Riverは新しいデータポイントから一つずつ学習することを可能にし、過去のデータに立ち戻る必要をなくし、コンセプトドリフト(時間の経過に伴う基礎となるデータ分布の変化)に対して堅牢なシステムを実現します。

仕組み

Riverは、予測とモデルの更新が逐次的に行われるストリーミングインターフェースを実装しています。learn_oneおよびpredict_oneパターンを提供し、モデルが一度に1つのサンプルを処理できるようにします。また、必要に応じてpandasを介したオプションのミニバッチインターフェース(learn_manypredict_many)もサポートしています。

対象者

イベントベースのプロダクション環境向けのモデルを構築する必要がある開発者やデータサイエンティスト、または時間の経過とともに変化するデータを扱う方に設計されています。

ハイライト

  • 多様なアルゴリズムスイート: 線形モデル、決定木、ランダムフォレスト、異常検知、ドリフト検知、レコメンダーシステムが含まれます。
  • CremeとScikit-Multiflowの統合: 2つの確立されたオンラインMLライブラリの機能を組み合わせています。
  • 包括的なツール群: オンライン統計、前処理、特徴抽出、および漸進的なモデル検証を提供します。
  • 使いやすいAPI: 明快さと使いやすさに重点を置き、Pythonエコシステムとスムーズに統合します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト