treeverse/dvc
🦉 Data Versioning and ML Experiments
해결하는 문제
DVC(Data Version Control)는 기계학습 프로젝트에서 재현성의 도전 과제를 해결합니다. Git으로는 처리할 수 없는 대규모 데이터셋과 ML 모델을 버전 관리할 수 있으며, 버전 관리 메타데이터는 Git에 유지되므로 코드, 데이터, 모델의 특정 버전이 항상 연결되어 있음을 보장합니다.
작동 방식
DVC는 Git 위에 계층을 구축합니다. 실제 데이터 및 모델 파일은 Git 저장소 외부의 별도 캐시에 저장되며, Git에는 가벼운 플레이스홀더 파일이 배치됩니다. 이 캐시를 공유하고 백업하기 위해 DVC는 S3, Azure, Google Cloud, 그리고 SSH를 통한 온프레미스 네트워크 스토리지와 같은 다양한 원격 스토리지 플랫폼을 지원합니다.
또한 코드와 데이터를 연결하는 계산 그래프(파이프라인)를 정의하는 시스템도 제공합니다. 이러한 파이프라인은 각 단계의 종속성과 출력을 지정하여 DVC가 변경의 영향을 받는 단계만 실행할 수 있도록 합니다.
대상 사용자
실험을 추적하고 데이터 및 모델을 버전 관리하며 재현 가능한 ML 파이프라인에서 협업이 필요한 머신러닝 엔지니어 및 데이터 과학자.
주요 기능
- 데이터용 Git: 전용 서버 없이 데이터 아티팩트와 모델을 버전 관리하고 공유 가능.
- 경량 파이프라인: 변경 사항의 영향을 받는 단계만 실행하는 버전 관리된 데이터 파이프라인.
- 로컬 실험 추적: 로컬 Git 리포지토리 내에서 하이퍼파라미터, 메트릭, 성능 플롯을 직접 추적하고 비교 가능.
- 클라우드 스토리지 통합: S3, Azure, GCS와 같은 클라우드 공급업체와의 시ーム리스한 데이터 푸시 및 풀.
- VS Code 확장: IDE 내에서 실험 추적 및 데이터 관리를 위한 GUI.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트