Hugging Face Datasets 音訊與視覺文件更新

Hugging Face Datasets 音訊與視覺文件更新

Hugging Face 已擴充 🤗 Datasets 函式庫的文件,加入針對音訊與視覺資料集的專屬指南與工具,簡化多模態資料的載入與處理流程。

Hugging Face Datasets 音訊與視覺文件更新

Hugging Face 已發布更新的文件與新工具,針對 ❈ Datasets 函式庫的音訊與視覺模式。此更新旨在標準化載入與處理非文字資料的體驗,使其與先前定義函式庫的 NLP 資料集一樣易於使用。

加強的多模態快速入門

❈ Datasets Quickstart 指南已更新,提供音訊、視覺與 NLP 資料集的端到端範例。這讓使用者能快速學習如何載入與處理特定模式的資料集,並為在 PyTorch 或 TensorFlow 中的訓練做好準備。

Quickstart 的主要更新包括:

  • TensorFlow Integration: 引入 to_tf_dataset 函式,可無縫將資料集轉換為 tf.data.Dataset。這消除了在使用 TensorFlow 或 Keras 時需要手動編寫程式碼來處理洗牌與批次載入的需求。

針對特定模式的文件指南

為了因應不同資料類型的獨特技術需求,Hugging Face 引入了專屬的文件章節。此重新組織確保模式特定的細節——例如透過 Audio 特徵自動解碼與重新取樣音訊信號——能清楚地與一般使用功能分離。

新的指南分為五個主要章節:

  1. General Usage:適用於所有資料集類型的廣泛函式。
  2. Audio:音訊處理的專屬指南。
  3. Vision:影像處理的專屬指南。
  4. Text:NLP 資料集的指南。
  5. Dataset Repository:管理資料集倉庫的資訊。

使用 ImageFolder 簡化影像載入

ImageFolder 資料集建構器消除了為影像分類任務編寫自訂載入腳本的需求。透過將影像依資料夾名稱作為標籤的目錄結構組織,使用者即可即時載入資料集。

除了基本的分類,ImageFolder 亦支援透過中繼資料檔案的複雜影像任務。若提供中繼資料檔案,ImageFolder 可用於:

  • Image Captioning:將影像與其文字說明連結。
  • Object Detection:將影像與邊界框座標及類別標籤連結。

未來路線圖

Hugging Face 正在努力將與文字相同的標準化程度帶入音訊與影像資料集。公司表示,未來將推出類似 ImageFolderAudioFolder 工具,以進一步簡化音訊資料集的管理。

Sources