lhotse-speech/lhotse

Tools for handling multimodal data in machine learning projects.

何を解決するか

Lhotseは、機械学習用にマルチモーダルデータ(音声、音声、動画、画像、テキスト)を準備する複雑なプロセスを簡素化します。手動で固定されたデータパイプラインを必要とせず、メタデータの扱い、データ拡張、大規模なトレーニング向け効率的なロードを柔軟に処理するツールを提供します。

動作方法

Lhotseは「カットベース」のアプローチを採用しており、音声や動画の記録は「カット」として表現されます。これは、ディスク上にすべての変種を保存する必要なく、オンザフライで混合、切り詰め、パディングが可能な仮想セグメントです。メタデータは人間が読みやすいテキストマニフェストで管理され、タスク固有のDatasetクラスを通じてPyTorchに直接統合されます。高性能I/Oには、Lhotse SharやWebDatasetといった順次形式をサポートし、分散マルチノードトレーニング中のデータロードを最適化します。

対象ユーザー

音声処理、マルチモーダルAI、大規模な音声/動画モデルトレーニングに取り組む研究者や開発者向けに設計されており、マスIVEデータセットをPython中心で管理したい人向けです。

特徴

  • マルチモーダル対応: 音声、テキスト、画像、動画のモダリティを扱います。
  • 効率的なデータロード: データセットのブレンドやオンザフライバケッティングに最先端のアルゴリズムを搭載。
  • 柔軟な操作: オンザフライでのデータカットの混合、切り詰め、パディングを可能にし、ストレージを最小限に抑えます。
  • PyTorch統合: カスタムDatasetクラスとサンプラーを通じてPyTorchとのシームレスな統合を提供。
  • 最適化されたストレージ: 順次I/O形式(Lhotse Shar)と圧縮された特徴ストレージ(lilcom)をサポートし、効率性を向上させます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト