Hugging Face 데이터셋 허브 검색 기능 업데이트

모달리티별 필터링

사용자는 이제 데이터셋에 포함된 데이터 유형을 기준으로 필터링할 수 있습니다. 모달리티는 파일 확장자와 내용에 따라 허브가 자동으로 감지합니다. 지원되는 모달리티 필터는 다음과 같습니다:

  • 텍스트
  • 이미지
  • 오디오
  • 표형
  • 시계열
  • 3D
  • 비디오
  • 지리공간

이 필터들은 다중 선택을 지원하여 텍스트와 이미지가 결합된 데이터와 같이 여러 모달리티를 포함하는 데이터셋을 찾을 수 있게 합니다.

데이터셋 크기별 필터링

데이터셋 허브는 이제 최소 및 최대 행 수를 지정하여 데이터셋을 검색할 수 있게 되었습니다. 이 기능을 통해 소규모 데이터셋부터 LLM 사전 학습에 사용되는 대규모 데이터셋까지 모두 발견할 수 있습니다.

지원되는 형식의 모든 데이터셋에 행 수가 제공됩니다. 메타데이터에 행 수가 명시되지 않은 경우, Hugging Face는 데이터셋의 처음 5GB 내용을 기반으로 전체 행 수를 추정합니다.

데이터 형식별 필터링

사용자는 이제 저장 형식에 따라 데이터셋을 필터링할 수 있습니다. 이는 특정 사용 사례에 맞게 데이터를 재포맷해야 하는지 여부를 판단하는 데 중요합니다. 허브는 형식마다 서로 다른 장단점이 있음을 강조합니다:

  • Parquet: 효율적인 필터링과 분석, 높은 압축 비율을 제공하지만 단일 행에 접근하려면 전체 행 그룹을 디코딩해야 합니다.
  • WebDataset: 높은 데이터 스트리밍 속도에 최적화되어 있지만 파일당 행 수와 같은 메타데이터가 부족해 다중 노드 학습 분배에 영향을 줄 수 있습니다.
  • Other formats: 일반적인 형식으로는 JSON Lines, CSV, 그리고 원시 텍스트 파일이 있습니다.

라이브러리 호환성별 필터링

데이터셋 허브는 이제 Pandas, Dask, 그리고 ‚‚ Datasets 라이브러리와 같이 데이터를 로드하고 준비하는 데 사용되는 라이브러리와 도구에 대한 필터를 포함합니다. 호환성은 데이터셋의 형식과 크기에 따라 결정됩니다(예: Dask는 Pandas의 메모리 한계를 초과하는 대규모 JSON Lines 데이터셋에 대해 표시됩니다).

통합을 간소화하기 위해 Hugging Face는 이러한 지원 도구를 사용해 데이터셋을 로드하는 코드 스니펫을 제공합니다.

검색 필터 결합

네 가지 새로운 필터(모달리티, 크기, 형식, 라이브러리)는 서로 및 기존 필터(예: 언어, 작업, 라이선스)와 결합하여 사용할 수 있습니다. 텍스트 검색 바와 함께 사용할 경우, 이러한 결합된 필터를 통해 매우 구체적인 데이터셋을 발견할 수 있습니다.

Sources