linkedin/venice

Venice, Derived Data Platform for Planet-Scale Workloads.

해결하는 문제

Venice는 행성 규모의 워크로드를 위한 파생 데이터 저장 플랫폼입니다. 오프라인, 네어라인, 온라인 데이터 세계 간의 격차를 메우며, ML 학습 작업에서 처리된 데이터를 온라인 추론 워크로드에서 저지연으로 접근할 수 있도록 하는 문제를 해결합니다.

작동 방식

Venice는 Feature Store의 백엔드로 사용할 수 있는 상태 유지 컴포넌트입니다. 배치(Hadoop, Spark) 및 스트리밍(Samza) 소스로부터 고처리량 비동기 인제스트를 지원합니다. 데이터는 CRDT 기반의 충돌 해결을 통해 여러 리전에 저장 및 복제됩니다.

사용자는 지연 시간 요구 사항에 따라 세 가지 다른 클라이언트 유형으로 데이터에 접근할 수 있습니다:

  • Thin Client: 상태 없음, < 10ms 지연 시간.
  • Fast Client: 파티션 인식, < 2ms 지연 시간.
  • Da Vinci Client: 상태 유지 로컬 캐시를 사용하여 < 1ms 지연 시간.

대상 사용자

스케일링 가능하고 다중 테넌트인 ML 특징 저장 계층이 필요한 엔지니어 및 AI 전문가를 위한 것입니다. ML 학습 작업의 출력을 실시간 추론 중 쿼리 가능한 시스템에 공급할 수 있습니다.

주요 특징

  • 유연한 인제스트: 배치 푸시, 인크리멘탈 푸시, 스트리밍 쓰기, 하이브리드 스토어를 지원합니다.
  • 읽기 계산: 내적 곱과 코사인 유사도와 같은 서버 측 연산을 가능하게 합니다.
  • 액티브-액티브 복제: CRDT 기반 충돌 해결을 통해 리전 간 고가용성을 보장합니다.
  • 다중 클라이언트 옵션: 비용 또는 성능 최적화를 위해 Thin, Fast, Da Vinci 클라이언트를 제공합니다.
  • 변경 데이터 캡처(CDC): 모든 데이터 변경 사항을 스트리밍하여 ML 특징 검색 및 인덱싱에 활용합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트