feast-dev/feast

The Open Source Feature Store for AI/ML

解決的問題

Feast 提供了一種集中管理機器學習特徵的方法,彌合了用於訓練的歷史數據與用於推理的即時數據之間的鴻溝。它透過確保時間點正確性來防止數據洩漏,並將機器學習模型與底層數據基礎設施解耦,使模型在不同環境中更具可移植性。

工作原理

Feast 作為一個數據存取層,將儲存與檢索抽象化。它管理兩種主要的儲存類型:

  • Offline Store: 處理用於批次評分或模型訓練的歷史數據。
  • Online Store: 為即時預測提供支援的低延遲儲存。

它包含一個用於提供預計算特徵的特徵伺服器,以及一個用於追蹤特徵定義的註冊表。使用者可以將數據從離線儲存物化(materialize)到線上儲存中以供即時使用。

適用對象

需要大規模將分析數據投入生產環境,用於模型訓練和線上推理的機器學習平台團隊與數據科學家。

亮點

  • 廣泛的基礎設施支援: 與各種數據源、離線儲存(如 Snowflake, BigQuery, DuckDB)和線上儲存(如 Redis, DynamoDB, Qdrant)整合。
  • 時間點正確性: 透過確保未來值不會洩漏到訓練集中,生成避免數據洩漏的特徵集。
  • 按需轉換: 支援在讀取或寫入時進行轉換,以動態處理特徵。
  • 特徵品質監控: 包括內建指標、漂移檢測和服務日誌監控。
  • 向量搜尋支援: 包括對用於 NLP 任務的 Milvus 和 Faiss 等向量儲存的 alpha 版本支援。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案