linkedin/venice

Venice, Derived Data Platform for Planet-Scale Workloads.

何を解決するか

Venice は、惑星規模のワークロード向けに設計された派生データストレージプラットフォームです。オフライン、ニアライン、オンラインのデータ世界の間のギャップを埋め、MLトレーニングジョブで処理されたデータをオンライン推論ワークロードで低レイテンシでアクセスできるようにする問題を解決します。

動作方法

Venice は、Feature Store をバックエンドとして利用できる状態保持型コンポーネントです。バッチ(Hadoop、Spark)およびストリーミング(Samza)ソースからの高スループット非同期インジェストをサポートします。データは CRDT を用いた競合解決により、複数リージョンにわたって格納・レプリケーションされます。

ユーザーは、レイテンシ要件に応じて3種類のクライアントタイプからアクセスできます:

  • Thin Client:ステートレスで < 10ms のレイテンシ。
  • Fast Client:パーティションを意識した設計で < 2ms のレイテンシ。
  • Da Vinci Client:状態保持型ローカルキャッシュを使用し、< 1ms のレイテンシ。

対象ユーザー

スケーラブルでマルチテナントなML特徴量ストレージレイヤーを必要とするエンジニアやAI実践者向けです。MLトレーニングジョブの出力を、推論時にリアルタイムでクエリ可能なシステムに供給できます。

主な特徴

  • 柔軟なインジェスト:バッチプッシュ、インクリメンタルプッシュ、ストリーミング書き込み、ハイブリッドストアをサポート。
  • 読み取り計算:ドット積やコサイン類似度などのサーバーサイド操作を可能にします。
  • アクティブ・アクティブレプリケーション:CRDT を用いた競合解決により、複数リージョン間で高可用性を確保。
  • マルチクライアントオプション:コストやパフォーマンス最適化に応じて、Thin、Fast、Da Vinci のクライアントを提供。
  • 変更データキャプチャ(CDC):すべてのデータ変更をストリーミングし、ML特徴量の取得やインデックス作成に活用。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト