Kaggle/kagglehub

Python library to access Kaggle resources

해결하는 문제

kagglehub는 Python에서 데이터셋, 모델, 경진대회 파일을 포함한 Kaggle 리소스에 직접 접근하는 과정을 단순화합니다. 수동으로 파일을 다운로드하거나 복잡한 API 호출을 관리하는 번거로움을 제거하고, Kaggle의 방대한 AI 자산을 로컬 또는 클라우드 기반 워크플로우에 원활하게 통합할 수 있는 간편한 방법을 제공합니다.

작동 방식

이 라이브러리는 Kaggle 생태계에 대한 Python 인터페이스 역할을 합니다. API 토큰을 통해 인증을 처리하거나, Kaggle 노트북 내에서는 자동으로 인증을 수행하며, 리소스의 다운로드 및 업로드를 관리합니다.

주요 기능:

  • 리소스 관리: 특정 버전의 모델이나 데이터셋을 다운로드하거나, 그 안의 개별 파일을 대상으로 할 수 있습니다.
  • 직접 로딩: KaggleDatasetAdapter를 통해 pandas DataFrame, Polars LazyFrame/DataFrame, Hugging Face Dataset과 같은 일반적인 데이터 과학 객체로 Kaggle 데이터셋을 직접 로드할 수 있습니다.
  • 환경 통합: Kaggle 노트북 내에서 사용할 경우, 리소스는 자동으로 노트북의 입력 패널에 연결되고 공유 캐시에서 제공되어 디스크 공간을 절약합니다. Kaggle 외부에서는 파일이 로컬 캐시 폴더에 저장됩니다.
  • 기여: 로컬 디렉터리에서 새로운 모델이나 데이터셋(또는 기존 항목의 새 버전)을 직접 업로드할 수 있습니다.

대상 사용자

Kaggle에서 모델과 데이터셋을 확보하거나, Kaggle 기여를 프로그래밍 방식으로 관리하고자 하는 데이터 과학자, ML 엔지니어, AI 연구자.

주요 특징

  • 다중 프레임워크 데이터 로딩: pandas, Polars, Hugging Face 형식으로 데이터를 직접 로드하는 네이티브 지원.
  • 유연한 다운로드: 전체 리소스, 특정 버전, 또는 단일 파일을 다운로드할 수 있습니다.
  • 노트북 통합 최적화: Kaggle 자체 노트북 환경에 최적화된 동작.
  • 포괄적인 업로드: 버전 설명과 파일 무시 패턴을 지정하여 모델과 데이터셋을 간단한 함수로 업로드할 수 있습니다.

관련

  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트
  • 프로젝트