Hugging Face Datasets 音訊與視覺文件更新
Hugging Face Datasets 音訊與視覺文件更新
Hugging Face 已擴充 🤗 Datasets 函式庫的文件,加入針對音訊與視覺資料集的專屬指南與工具,簡化多模態資料的載入與處理流程。
Hugging Face Datasets 音訊與視覺文件更新
Hugging Face 已發布更新的文件與新工具,針對 ❈ Datasets 函式庫的音訊與視覺模式。此更新旨在標準化載入與處理非文字資料的體驗,使其與先前定義函式庫的 NLP 資料集一樣易於使用。
加強的多模態快速入門
❈ Datasets Quickstart 指南已更新,提供音訊、視覺與 NLP 資料集的端到端範例。這讓使用者能快速學習如何載入與處理特定模式的資料集,並為在 PyTorch 或 TensorFlow 中的訓練做好準備。
Quickstart 的主要更新包括:
- TensorFlow Integration: 引入
to_tf_dataset函式,可無縫將資料集轉換為tf.data.Dataset。這消除了在使用 TensorFlow 或 Keras 時需要手動編寫程式碼來處理洗牌與批次載入的需求。
針對特定模式的文件指南
為了因應不同資料類型的獨特技術需求,Hugging Face 引入了專屬的文件章節。此重新組織確保模式特定的細節——例如透過 Audio 特徵自動解碼與重新取樣音訊信號——能清楚地與一般使用功能分離。
新的指南分為五個主要章節:
- General Usage:適用於所有資料集類型的廣泛函式。
- Audio:音訊處理的專屬指南。
- Vision:影像處理的專屬指南。
- Text:NLP 資料集的指南。
- Dataset Repository:管理資料集倉庫的資訊。
使用 ImageFolder 簡化影像載入
ImageFolder 資料集建構器消除了為影像分類任務編寫自訂載入腳本的需求。透過將影像依資料夾名稱作為標籤的目錄結構組織,使用者即可即時載入資料集。
除了基本的分類,ImageFolder 亦支援透過中繼資料檔案的複雜影像任務。若提供中繼資料檔案,ImageFolder 可用於:
- Image Captioning:將影像與其文字說明連結。
- Object Detection:將影像與邊界框座標及類別標籤連結。
未來路線圖
Hugging Face 正在努力將與文字相同的標準化程度帶入音訊與影像資料集。公司表示,未來將推出類似 ImageFolder 的 AudioFolder 工具,以進一步簡化音訊資料集的管理。