meta-pytorch/torchcodec

Media decoding and encoding for PyTorch: videos, images, and audio, on CPU and GPU.

해결하는 문제

TorchCodec는 미디어 파일(비디오, 오디오 및 이미지)을 PyTorch 텐서로 직접 디코딩 및 인코딩하는 PyTorch 네이티브 방식을 제공합니다. 이를 통해 FFmpeg를 수동으로 사용하는 복잡성을 제거하고, 번거로운 변환 단계 없이 미디어 데이터가 머신러닝 모델에 즉시 준비되도록 보장합니다.

작동 방식

이 라이브러리는 비디오 및 오디오 처리를 위한 FFmpeg의 복잡성을 추상화하는 동시에 이미지 전용 디코더를 제공합니다. PyTorch 관례를 반영한 Pythonic API를 제공하여 사용자가 CPU 또는 CUDA GPU에서 미디어를 텐서로 로드할 수 있도록 합니다. 또한 비디오 스트림에 대한 시간 기반 인덱싱 및 메타데이터 추출을 지원합니다.

대상 사용자

PyTorch 기반 워크플로우에서 학습 또는 추론을 위해 미디어 데이터를 효율적으로 로드하고 처리해야 하는 ML 엔지니어 및 연구자.

주요 특징

  • PyTorch 통합: 데이터를 텐서로 반환하여 PyTorch transforms 및 모델 학습과 호환됩니다.
  • 하드웨어 가속: CPU 및 CUDA GPU(NVDEC/NVENC 포함) 모두에서 디코딩 및 인코딩을 지원합니다.
  • 유연한 인덱싱: 비디오 프레임에 대해 간단한 인덱싱, 시간 기반 인덱싱 및 PTS (Presentation Time Stamp) 검색을 제공합니다.
  • 폭넓은 포맷 지원: 다양한 이미지 포맷(JPEG, PNG, WebP, GIF, AVIF, HEIC)과 FFmpeg를 통한 비디오/오디오를 처리합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트