4paradigm/OpenMLDB

OpenMLDB is an open-source machine learning database that provides a feature platform computing consistent features for training and inference.

何を解決するか

OpenMLDBは機械学習におけるオフライン特徴量エンジニアリングとオンライン推論のギャップを埋めます。エンジニアリングチームがPythonスクリプトをC++やデータベースコードに再構成する必要がなくなり、データ漏洩、特徴量の後方補完、トレーニングとサービングの不一致(トレーニング・サービングスケュー)といった一般的な問題を解決します。

仕組み

OpenMLDBは「開発=デプロイ」の哲学を実装する特徴量プラットフォームとして機能します。SQLを統一されたプログラミング言語として使用して特徴量を定義し、それを2つの専用エンジンが処理します:

  • バッチSQLエンジン: オフライントレーニングデータ生成用にカスタマイズされたSparkディストリビューションに基づく。
  • リアルタイムSQLエンジン: 時系列データに最適化された独自開発エンジンで、オンライン推論用の超低遅延特徴量を提供。

統一された実行計画ジェネレータがこれらの2つのエンジンを橋渡しし、同じSQLロジックがトレーニングまたはサービングに使用されても一貫した特徴量を生成することを保証します。

対象ユーザー

生産環境向け機械学習アプリケーションでリアルタイム特徴量を提供する必要があるデータサイエンティストやMLエンジニア、たとえばパーソナライズド推薦、リスク分析、IoTモニタリングなど。

特徴

  • 一貫性のある特徴量: オフライントレーニングとオンライン推論の間に一貫性を保ち、データ漏洩を防止。
  • 超低遅延: 数ミリ秒で特徴量を生成可能な独自のリアルタイムエンジン。
  • SQLベースの定義: LAST JOINWINDOW UNION などの拡張SQL構文を使用して、特徴量管理を容易に。
  • プロダクション対応: 分散ストレージ、障害回復、高可用性、スムーズなスケールアウトをサポート。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト