fluid-cloudnative/fluid

Fluid, elastic data abstraction and acceleration for BigData/AI applications in cloud. (Project under CNCF)

해결하는 문제

Fluid는 Kubernetes에서 실행되는 대규모 데이터 및 AI 학습 작업에 있어 데이터 접근과 관련된 성능 저하 문제를 해결합니다. 분산 시스템 전반에서 데이터셋을 관리하고 캐시함으로써, TensorFlow나 Spark와 같은 컴퓨팅 엔진이 원격 스토리지에서 데이터를 기다리는 시간을 줄여 데이터 접근 속도를 가속화합니다.

작동 방식

Fluid는 Kubernetes 네이티브 분산 데이터셋 오케스트레이터 및 가속기로 작동합니다. 다음과 같은 두 가지 핵심 개념을 도입합니다:

  • Dataset: 컴퓨팅 엔진이 사용하는 관련 데이터의 논리적 그룹. Fluid는 스토리지 소스에 관계없이 이러한 데이터셋에 대해 통합된 추상화를 제공합니다.
  • Runtime: 격리, 공유, 버전 관리를 강제하고 데이터셋의 수명 주기 전반에서 데이터를 처리할 수 있는 인터페이스를 제공하는 컴포넌트로, 데이터 가속을 가능하게 합니다.

시스템은 데이터 캐싱 기술과 유연한 확장성, 데이터 근접 스케줄링을 결합하여 데이터를 계산 작업에 물리적으로 가깝게 유지함으로써 높은 성능을 보장합니다.

대상 사용자

Kubernetes에서 AI 및 대규모 데이터 워크로드를 관리하는 개발자 및 플랫폼 엔지니어로, 학습 작업이나 분석 작업의 데이터 로딩 속도와 데이터 접근 성능을 최적화해야 하는 사용자들입니다.

주요 특징

  • 데이터셋 추상화: 다양한 스토리지 소스에서 온 데이터셋에 대한 통합 추상화와 모니터링 기능 제공.
  • 확장 가능한 캐시 런타임: 다양한 런타임 및 제3자 스토리지 시스템 간의 데이터 작업에 대한 통합 접근 인터페이스 제공.
  • 자동화된 데이터 작업: 시스템 통합을 용이하게 하는 다양한 자동화 모드 지원.
  • 유연성과 스케줄링: 캐싱과 유연한 확장성, 데이터 근접 스케줄링을 결합하여 성능 향상.
  • 플랫폼 독립성: 네이티브, 엣지, Serverless Kubernetes 클러스터 및 멀티클러스터 환경을 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트