linkedin/venice

Venice, Derived Data Platform for Planet-Scale Workloads.

解決的問題

Venice 是一個為行星規模工作負載設計的衍生資料儲存平台。它彌合了離線、近線與線上資料世界之間的差距,專門解決如何為機器學習訓練作業處理過的資料提供低延遲存取,以支援線上推論工作負載的問題。

工作原理

Venice 作為一個有狀態元件,可作為特徵儲存的後端。它支援從批次(Hadoop、Spark)與串流(Samza)來源進行高吞吐量的非同步輸入。資料透過基於 CRDT 的衝突解決機制,在多個區域之間儲存與複製,以確保一致性。

使用者可根據延遲需求,透過三種不同類型的客戶端存取資料:

  • 輕量客戶端:無狀態,延遲 < 10ms。
  • 快速客戶端:具備分區感知,延遲 < 2ms。
  • 達文西客戶端:使用有狀態的本地快取,延遲 < 1ms。

適用對象

專為需要可擴展、多租戶的機器學習特徵儲存層的工程師與 AI 實務者設計,使他們能將機器學習訓練作業的輸出輸入至一個可在推論過程中即時查詢的系統中。

主要亮點

  • 彈性輸入:支援批次推送、增量推送、串流寫入與混合儲存。
  • 讀取運算:支援伺服器端運算,如點積與餘弦相似度。
  • 主動-主動複製:透過基於 CRDT 的衝突解決機制,確保跨區域的高可用性。
  • 多客戶端選項:提供多種客戶端(輕量、快速、達文西),以優化成本或效能。
  • 變更資料捕獲(CDC):串流傳輸所有資料變更,用於機器學習特徵檢索與索引。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案