linkedin/venice
Venice, Derived Data Platform for Planet-Scale Workloads.
何を解決するか
Venice は、惑星規模のワークロード向けに設計された派生データストレージプラットフォームです。オフライン、ニアライン、オンラインのデータ世界の間のギャップを埋め、MLトレーニングジョブで処理されたデータをオンライン推論ワークロードで低レイテンシでアクセスできるようにする問題を解決します。
動作方法
Venice は、Feature Store をバックエンドとして利用できる状態保持型コンポーネントです。バッチ(Hadoop、Spark)およびストリーミング(Samza)ソースからの高スループット非同期インジェストをサポートします。データは CRDT を用いた競合解決により、複数リージョンにわたって格納・レプリケーションされます。
ユーザーは、レイテンシ要件に応じて3種類のクライアントタイプからアクセスできます:
- Thin Client:ステートレスで < 10ms のレイテンシ。
- Fast Client:パーティションを意識した設計で < 2ms のレイテンシ。
- Da Vinci Client:状態保持型ローカルキャッシュを使用し、< 1ms のレイテンシ。
対象ユーザー
スケーラブルでマルチテナントなML特徴量ストレージレイヤーを必要とするエンジニアやAI実践者向けです。MLトレーニングジョブの出力を、推論時にリアルタイムでクエリ可能なシステムに供給できます。
主な特徴
- 柔軟なインジェスト:バッチプッシュ、インクリメンタルプッシュ、ストリーミング書き込み、ハイブリッドストアをサポート。
- 読み取り計算:ドット積やコサイン類似度などのサーバーサイド操作を可能にします。
- アクティブ・アクティブレプリケーション:CRDT を用いた競合解決により、複数リージョン間で高可用性を確保。
- マルチクライアントオプション:コストやパフォーマンス最適化に応じて、Thin、Fast、Da Vinci のクライアントを提供。
- 変更データキャプチャ(CDC):すべてのデータ変更をストリーミングし、ML特徴量の取得やインデックス作成に活用。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト