lhotse-speech/lhotse
Tools for handling multimodal data in machine learning projects.
解決的問題
Lhotse 簡化了為機器學習準備多模態資料(語音、音訊、影片、影像與文字)的複雜過程。它透過提供靈活的工具來處理元資料、資料增強,以及大規模訓練的高效載入,消除了對手動、僵化資料流程的需求。
工作原理
Lhotse 採用「切片(cut-based)」方法,將音訊或影片錄音表示為「切片」——這些是可以在不將每種變形都儲存在磁碟上的情況下,即時混合、截斷或填補的虛擬片段。它使用人類可讀的文本清單(manifests)來管理元資料,並透過特定任務的 Dataset 類別直接與 PyTorch 集成。為了實現高效能 I/O,它支援 Lhotse Shar 與 WebDataset 等順序格式,以優化分散式多節點訓練期間的資料載入。
適用對象
專為從事語音處理、多模態 AI 與大規模音訊/影片模型訓練的研究人員與開發者設計,適合需要以 Python 為中心方式管理龐大資料集的使用者。
主要亮點
- 多模態支援:支援音訊、文字、影像與影片模態。
- 高效資料載入:具備先進的資料集混合與即時分桶演算法。
- 靈活操作:支援即時混合、截斷與填補資料切片,以最小化儲存需求。
- PyTorch 集成:透過自訂 Dataset 類別與取樣器,與 PyTorch 實現無縫整合。
- 優化儲存:支援順序 I/O 格式(Lhotse Shar)與壓縮特徵儲存(lilcom),提升效率。
相關
- 專案
- 專案
- 專案
- 專案
- 專案