meta-pytorch/torchcodec

Media decoding and encoding for PyTorch: videos, images, and audio, on CPU and GPU.

解決する課題

TorchCodecは、メディアファイル(ビデオ、オーディオ、画像)をPyTorchテンソルに直接デコードおよびエンコードするPyTorchネイティブな方法を提供します。これにより、FFmpegを手動で使用する複雑さが排除され、煩雑な変換ステップなしにメディアデータが機械学習モデルに即座に利用できる状態になります。

仕組み

このライブラリは、ビデオおよびオーディオ処理におけるFFmpegの複雑さを抽象化し、画像用の専用デコーダーを提供します。PyTorchの慣習を反映したPythonicなAPIを提供し、ユーザーはCPUまたはCUDA GPU上でメディアをテンソルとしてロードできます。また、ビデオストリームのタイムベースのインデックス作成とメタデータ抽出をサポートしています。

対象ユーザー

PyTorchベースのワークフローにおいて、トレーニングまたは推論のためにメディアデータを効率的にロードおよび処理する必要があるMLエンジニアおよび研究者。

ハイライト

  • PyTorchとの統合: データはテンソルとして返されるため、PyTorchのtransformsやモデルのトレーニングとの互換性があります。
  • ハードウェアアクセラレーション: CPUとCUDA GPU(NVDEC/NVENCを含む)の両方でのデコードおよびエンコードをサポートしています。
  • 柔軟なインデックス作成: ビデオフレームに対して、シンプルなインデックス作成、タイムベースのインデックス作成、およびPTS (Presentation Time Stamp) の取得を提供します。
  • 幅広いフォーマットサポート: さまざまな画像フォーマット(JPEG, PNG, WebP, GIF, AVIF, HEIC)およびFFmpeg経由のビデオ/オーディオを処理します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト