lhotse-speech/lhotse

Tools for handling multimodal data in machine learning projects.

解决的问题

Lhotse 简化了为机器学习准备多模态数据(语音、音频、视频、图像和文本)的复杂过程。它通过提供灵活的工具来处理元数据、数据增强和大规模训练的高效加载,消除了对手动、僵化数据流水线的需求。

工作原理

Lhotse 采用“切片(cut-based)”方法,将音频或视频录音表示为“切片”——这些是可以在不将每种变体都存储在磁盘上的情况下,实时混合、截断或填充的虚拟片段。它使用人类可读的文本清单(manifests)来管理元数据,并通过特定任务的 Dataset 类直接与 PyTorch 集成。为了实现高性能 I/O,它支持 Lhotse Shar 和 WebDataset 等顺序格式,以优化分布式多节点训练期间的数据加载。

适用人群

专为从事语音处理、多模态 AI 和大规模音频/视频模型训练的研究人员和开发者设计,适合需要以 Python 为中心的方式管理海量数据集的用户。

主要亮点

  • 多模态支持:支持音频、文本、图像和视频模态。
  • 高效数据加载:具备最先进的数据集混合和实时分桶算法。
  • 灵活操作:支持实时混合、截断和填充数据切片,以最小化存储需求。
  • PyTorch 集成:通过自定义 Dataset 类和采样器,与 PyTorch 实现无缝集成。
  • 优化存储:支持顺序 I/O 格式(Lhotse Shar)和压缩特征存储(lilcom),提升效率。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目