linkedin/venice

Venice, Derived Data Platform for Planet-Scale Workloads.

解决的问题

Venice 是一个为行星规模工作负载设计的派生数据存储平台。它弥合了离线、近线和在线数据世界之间的差距,专门解决如何为机器学习训练作业处理过的数据提供低延迟访问,以支持在线推理工作负载的问题。

工作原理

Venice 作为一个有状态组件,可以作为特征存储的后端。它支持从批处理(Hadoop、Spark)和流式(Samza)源进行高吞吐量的异步摄入。数据通过基于 CRDT 的冲突解决机制在多个区域之间存储和复制,以确保一致性。

用户可根据延迟需求,通过三种不同类型的客户端访问数据:

  • 轻量客户端:无状态,延迟 < 10ms。
  • 快速客户端:分区感知,延迟 < 2ms。
  • 达·芬奇客户端:使用有状态本地缓存,延迟 < 1ms。

适用人群

专为需要可扩展、多租户的机器学习特征存储层的工程师和 AI 实践者设计,使他们能够将机器学习训练作业的输出输入到一个可在推理过程中实时查询的系统中。

主要亮点

  • 灵活的摄入方式:支持批量推送、增量推送、流式写入和混合存储。
  • 读取计算:支持服务器端操作,如点积和余弦相似度。
  • 主动-主动复制:通过基于 CRDT 的冲突解决机制,确保跨区域的高可用性。
  • 多客户端选项:提供多种客户端(轻量、快速、达·芬奇),以优化成本或性能。
  • 变更数据捕获(CDC):流式传输所有数据变更,用于机器学习特征检索和索引。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目