CurvineIO/curvine

AI-Native & Cloud-Native FS: A high-performance file semantic layer for cloud object storage, integrated with high-speed cache. CNCF Sandbox Project.

무엇을 해결하는가

Curvine은 클라우드 오브젝트 스토리지(AWS S3 등)와 대규모 AI 워크로드의 고속 데이터 액세스 요구 사항 사이의 간극을 메우기 위해 설계된 고성능 파일 시스템입니다. AI 트레이닝, 추론 및 AI Agent 플랫폼이 클라우드에 저장된 대규모 데이터 세트 또는 모델 체크포인트를 액세스할 때 발생하는 느린 데이터 검색 및 높은 지연 시간을 해결합니다.

작동 방식

Curvine은 클라우드 오브젝트 스토리지 위에 분산 POSIX 준수 파일 시스템을 레이어로 구축합니다. 멀티 티어 분산 캐시(Memory $\rightarrow$ SSD $\rightarrow$ HDD)를 사용하여 핫 데이터를 컴퓨팅 노드 근처에 유지합니다.

아키텍처는 다음과 같이 구성됩니다:

  • Access Layer: AI Agent pod 및 빅데이터 엔진을 지원합니다.
  • Protocol Layer: FUSE client, S3-compatible gateway, HDFS adapter 및 Kubernetes CSI driver를 포함한 여러 액세스 경로를 제공합니다.
  • Cluster Core: Raft로 복제된 Master node가 메타데이터를 관리하고 조정하며, Worker node가 실제 데이터 I/O 및 캐싱을 처리합니다.
  • Storage Layer: 멀티 클라우드 오브젝트 스토리지를 내구성이 있는 영구 지속성 레이어로 사용합니다.

대상 사용자

  • AI Engineers: LLM 트레이닝 및 여러 리전 간의 모델 배포를 가속화하려는 엔지니어.
  • AI Agent Platform Developers: Kubernetes 상에서 수천 개의 상태 저장 Agent pod에 대해 격리된 고성능 POSIX 워크스페이스를 제공해야 하는 개발자.
  • Data Engineers: 멀티모달 데이터 레이크를 관리하거나 컴퓨팅-스토리지 분리 아키텍처를 사용하여 OLAP 쿼리를 가속화하려는 엔지니어.

주요 특징

  • AI-Native Design: AI 트레이닝 가속화 및 AI Agent 스토리지에 특화되어 최적화되었습니다.
  • Extreme Performance: Rust로 구축되어 제로 카피 데이터 경로를 제공하며, ~100$\mu$s급 지연 시간과 100K+ QPS를 달성합니다.
  • Massive Metadata Capacity: 클러스터당 최대 50억 개의 작은 파일을 지원하여 고동시성 Agent 워크로드를 처리하기에 적합합니다.
  • Cloud-Native Integration: 네이티브 Kubernetes CSI driver를 통해 밀리초 단위의 PVC 프로비저닝이 가능합니다.
  • Multi-Cloud Compatibility: AWS S3, Azure Blob, Google GCS 및 기타 S3 호환 스토리지에서 투명하게 작동합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트