NVIDIA/aistore

AIStore: scalable storage for AI applications

해결하는 문제

AIStore (AIS)는 AI 및 머신러닝 워크로드에서 흔히 발생하는 스토리지 병목 문제를 해결합니다. 여러 클라우드 백엔드와 로컬 클러스터를 통해 대규모 데이터셋을 처리할 수 있는 고성능, 확장 가능한 분산 스토리지 스택을 제공하며, 원격 데이터를 단순한 캐시로 취급할 때 일반적으로 발생하는 성능 저하를 피합니다.

작동 방식

AIS는 베어메탈 리눅스 머신 또는 쿠버네티스에 배포할 수 있는 유연한 스토리지 노드와 게이트웨이 클러스터로 작동합니다. 독립된 클러스터 간에 데이터를 관리하기 위한 유니파이드 네임스페이스를 사용하며, 네이티브 HTTP 기반 API와 S3 호환 API를 지원합니다. ML 파이프라인의 오버헤드를 줄이기 위해 한 번의 호출로 전체 트레이닝 배치를 가져올 수 있는 "Get-Batch" 작업을 제공합니다. 또한 ETL 오프로드를 지원하여 데이터 변환을 스토리지 노드에서 직접 수행해 데이터 이동을 최소화합니다.

대상 사용자

페타스케일 데이터셋을 관리하고 트레이닝 클러스터로 고속 데이터 전달을 보장해야 하는 AI 연구자, 데이터 과학자, ML 엔지니어를 위한 것입니다.

주요 특징

  • 멀티클라우드 접근: AWS S3, GCS, Azure, OCI 간 콘텐츠를 원활하게 관리.
  • 선형 확장성: 클러스터 노드 수가 증가해도 일관된 성능 유지.
  • Get-Batch: TAR 또는 기타 직렬화 형식으로 여러 개의 객체를 한 번의 작업으로 가져와 ML 파이프라인에 최적화.
  • ETL 오프로드: 데이터 근처에서 I/O 집약적인 변환을 인라인 또는 배치 처리로 수행.
  • 유연한 배포: 단일 Linux VM부터 페타스케일 쿠버네티스 클러스터까지 어디서나 실행 가능.
  • 네이티브 PyTorch 통합: PyTorch 워크플로우용 전용 데이터셋, 샘플러, 데이터로더 포함.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트