Hugging Face 数据集音频与视觉文档更新

Hugging Face 发布了更新的文档和新工具,针对 ❈ Datasets 库的音频和视觉模态。此更新旨在统一加载和处理非文本数据的体验,使其与此前定义库的 NLP 数据集一样易于使用。

增强的多模态快速入门

❈ Datasets 快速入门指南已更新,提供音频、视觉和 NLP 数据集的端到端示例。这样用户可以快速学习如何加载和处理特定模态的数据集,以便在 PyTorch 或 TensorFlow 中进行训练。

  • TensorFlow 集成:引入 to_tf_dataset 函数,可无缝将数据集转换为 tf.data.Dataset。这消除了在使用 TensorFlow 或 Keras 时手动编写代码进行洗牌和批量加载的需求。

针对模态的文档指南

为满足不同数据类型的独特技术需求,Hugging Face 引入了专门的文档章节。此重新组织确保模态特定的细节——例如通过 Audio 特性自动解码和重采样音频信号——与通用使用函数明确分离。

新的指南分为五个主要部分:

  1. 通用使用:适用于所有数据集类型的广泛函数。
  2. 音频:音频处理的专门指南。
  3. 视觉:图像处理的专门指南。
  4. 文本:NLP 数据集的指南。
  5. 数据集仓库:关于管理数据集仓库的信息。

使用 ImageFolder 简化图像加载

ImageFolder 数据集构建器消除了为图像分类任务编写自定义加载脚本的需求。通过将图像组织在目录结构中,文件夹名称作为标签,用户可以即时加载数据集。

除了基本分类,ImageFolder 通过元数据文件支持复杂的图像任务。如果提供元数据文件,ImageFolder 可用于:

  • 图像字幕:将图像与其文本描述关联。
  • 目标检测:将图像与边界框坐标和类别标签关联。

未来路线图

Hugging Face 正在努力将与文本相同水平的标准化引入音频和图像数据集。公司已表示,计划在未来发布类似于 ImageFolderAudioFolder 工具,以进一步简化音频数据集的管理。

Sources