lhotse-speech/lhotse

Tools for handling multimodal data in machine learning projects.

해결하는 문제

Lhotse는 기계학습을 위한 다중 모달 데이터(음성, 오디오, 비디오, 이미지, 텍스트)를 준비하는 복잡한 과정을 단순화합니다. 수동적이고 고정된 데이터 파이프라인을 필요로 하지 않고, 메타데이터 처리, 데이터 증강, 대규모 학습을 위한 효율적인 로딩을 위한 유연한 도구를 제공합니다.

작동 방식

Lhotse는 오디오 또는 비디오 녹음을 "컷"으로 표현하는 "컷 기반" 접근 방식을 사용합니다. 이는 디스크에 모든 변형을 저장할 필요 없이 실시간으로 혼합, 자르기, 패딩이 가능한 가상 세그먼트입니다. 메타데이터는 인간이 읽기 쉬운 텍스트 매니페스트로 관리하고, 태스크별 Dataset 클래스를 통해 PyTorch에 직접 통합됩니다. 고성능 I/O를 위해 Lhotse Shar 및 WebDataset과 같은 순차적 형식을 지원하여 분산 다중 노드 학습 중 데이터 로딩을 최적화합니다.

대상 사용자

음성 처리, 다중 모달 AI, 대규모 오디오/비디오 모델 학습에 종사하는 연구자 및 개발자에게 설계되었으며, 대규모 데이터셋을 Python 중심으로 관리하고자 하는 사용자에게 적합합니다.

주요 특징

  • 다중 모달 지원: 오디오, 텍스트, 이미지, 비디오 모달을 모두 처리합니다.
  • 효율적인 데이터 로딩: 데이터셋 블렌딩 및 실시간 버킷화에 최첨단 알고리즘을 제공합니다.
  • 유연한 조작: 저장 공간을 최소화하기 위해 실시간으로 데이터 컷을 혼합, 자르기, 패딩할 수 있습니다.
  • PyTorch 통합: 커스텀 Dataset 클래스와 샘플러를 통해 PyTorch와 원활하게 통합됩니다.
  • 최적화된 저장: 순차적 I/O 형식(Lhotse Shar)과 압축된 특징 저장(lilcom)을 지원하여 효율성을 높입니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트