meta-pytorch/torchcodec
Media decoding and encoding for PyTorch: videos, images, and audio, on CPU and GPU.
解決する課題
TorchCodecは、メディアファイル(ビデオ、オーディオ、画像)をPyTorchテンソルに直接デコードおよびエンコードするPyTorchネイティブな方法を提供します。これにより、FFmpegを手動で使用する複雑さが排除され、煩雑な変換ステップなしにメディアデータが機械学習モデルに即座に利用できる状態になります。
仕組み
このライブラリは、ビデオおよびオーディオ処理におけるFFmpegの複雑さを抽象化し、画像用の専用デコーダーを提供します。PyTorchの慣習を反映したPythonicなAPIを提供し、ユーザーはCPUまたはCUDA GPU上でメディアをテンソルとしてロードできます。また、ビデオストリームのタイムベースのインデックス作成とメタデータ抽出をサポートしています。
対象ユーザー
PyTorchベースのワークフローにおいて、トレーニングまたは推論のためにメディアデータを効率的にロードおよび処理する必要があるMLエンジニアおよび研究者。
ハイライト
- PyTorchとの統合: データはテンソルとして返されるため、PyTorchのtransformsやモデルのトレーニングとの互換性があります。
- ハードウェアアクセラレーション: CPUとCUDA GPU(NVDEC/NVENCを含む)の両方でのデコードおよびエンコードをサポートしています。
- 柔軟なインデックス作成: ビデオフレームに対して、シンプルなインデックス作成、タイムベースのインデックス作成、およびPTS (Presentation Time Stamp) の取得を提供します。
- 幅広いフォーマットサポート: さまざまな画像フォーマット(JPEG, PNG, WebP, GIF, AVIF, HEIC)およびFFmpeg経由のビデオ/オーディオを処理します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト