feast-dev/feast
The Open Source Feature Store for AI/ML
解決的問題
Feast 提供了一種集中管理機器學習特徵的方法,彌合了用於訓練的歷史數據與用於推理的即時數據之間的鴻溝。它透過確保時間點正確性來防止數據洩漏,並將機器學習模型與底層數據基礎設施解耦,使模型在不同環境中更具可移植性。
工作原理
Feast 作為一個數據存取層,將儲存與檢索抽象化。它管理兩種主要的儲存類型:
- Offline Store: 處理用於批次評分或模型訓練的歷史數據。
- Online Store: 為即時預測提供支援的低延遲儲存。
它包含一個用於提供預計算特徵的特徵伺服器,以及一個用於追蹤特徵定義的註冊表。使用者可以將數據從離線儲存物化(materialize)到線上儲存中以供即時使用。
適用對象
需要大規模將分析數據投入生產環境,用於模型訓練和線上推理的機器學習平台團隊與數據科學家。
亮點
- 廣泛的基礎設施支援: 與各種數據源、離線儲存(如 Snowflake, BigQuery, DuckDB)和線上儲存(如 Redis, DynamoDB, Qdrant)整合。
- 時間點正確性: 透過確保未來值不會洩漏到訓練集中,生成避免數據洩漏的特徵集。
- 按需轉換: 支援在讀取或寫入時進行轉換,以動態處理特徵。
- 特徵品質監控: 包括內建指標、漂移檢測和服務日誌監控。
- 向量搜尋支援: 包括對用於 NLP 任務的 Milvus 和 Faiss 等向量儲存的 alpha 版本支援。
相關
- 專案
- 專案
- 專案
- 專案
- 專案