Hugging Face Datasets 오디오 및 비전 문서 업데이트

Hugging Face는 ❈ Datasets 라이브러리를 위한 업데이트된 문서와 새로운 도구들을 공개했습니다. 특히 오디오와 비전 모달리티를 대상으로 합니다. 이번 업데이트는 텍스트가 아닌 데이터를 로드하고 처리하는 경험을 표준화하여, 이전에 라이브러리를 정의했던 NLP 데이터셋만큼 접근하기 쉽게 만드는 것을 목표로 합니다.

향상된 멀티모달 퀵스타트

❈ Datasets 퀵스타트 가이드를 업데이트하여 오디오, 비전, NLP 데이터셋에 대한 엔드‑투‑엔드 예제를 제공하고 있습니다. 이를 통해 사용자는 자신이 원하는 모달리티에 맞는 데이터셋을 로드하고 처리하는 방법을 빠르게 배우고, PyTorch 또는 TensorFlow에서 학습할 수 있도록 준비할 수 있습니다.

퀵스타트에 대한 주요 업데이트는 다음과 같습니다:

  • TensorFlow 통합: to_tf_dataset 함수의 도입으로 데이터셋을 tf.data.Dataset으로 원활하게 변환할 수 있습니다. 이를 통해 TensorFlow 또는 Keras를 사용할 때 셔플링 및 배치 로딩을 처리하는 수동 코드를 작성할 필요가 없어집니다.

모달리티별 문서 가이드

다양한 데이터 유형의 고유한 기술적 요구사항을 다루기 위해 Hugging Face는 전용 문서 섹션을 도입했습니다. 이번 재구성을 통해 Audio 기능을 통한 오디오 신호의 자동 디코딩 및 리샘플링과 같은 모달리티별 미묘함이 일반 사용 함수와 명확히 구분됩니다.

새 가이드는 다섯 개 주요 섹션으로 구분됩니다:

  1. General Usage: 모든 데이터셋 유형에 적용 가능한 광범위한 함수들.
  2. Audio: 오디오 처리에 대한 전용 가이드.
  3. Vision: 이미지 처리에 대한 전용 가이드.
  4. Text: NLP 데이터셋을 위한 가이드.
  5. Dataset Repository: 데이터셋 저장소 관리에 대한 정보.

ImageFolder를 활용한 이미지 로드 간소화

ImageFolder 데이터셋 빌더를 사용하면 이미지 분류 작업을 위한 맞춤형 데이터셋 로드 스크립트를 작성할 필요가 없습니다. 폴더 이름을 라벨로 사용하는 디렉터리 구조로 이미지를 정리하면 사용자는 즉시 데이터셋을 로드할 수 있습니다.

기본 분류 외에도, ImageFolder는 메타데이터 파일을 통해 복잡한 이미지 작업을 지원합니다. 메타데이터 파일이 제공되면 ImageFolder를 다음과 같이 사용할 수 있습니다:

  • Image Captioning: 이미지와 해당 텍스트 설명을 연결.
  • Object Detection: 이미지와 경계 상자 좌표 및 카테고리 라벨을 연결.

향후 로드맵

Hugging Face는 텍스트와 마찬가지로 오디오 및 이미지 데이터셋에도 동일한 수준의 표준화를 적용하기 위해 노력하고 있습니다. 회사는 ImageFolder와 유사한 AudioFolder 도구를 향후 출시하여 오디오 데이터셋 관리를 더욱 간소화할 계획이라고 밝혔습니다.

Sources