open-gigaai/giga-datasets

GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization

解決的問題

GigaDatasets 提供了一個統一且輕量的框架,用於管理人工智慧訓練與推論中使用的大型數據集。它簡化了資料整理、打包、載入與評估的複雜流程,確保在不同資料格式與結構之間保持一致性。

如何運作

此框架透過一系列專用工具,針對資料流程的不同階段運作:

  • 資料打包:使用 Writer 類別(如 PklWriterFileWriterLmdbWriter)將非結構化的原始資料(如影像與 JSON 標註)轉換為結構化、高效的格式。
  • 資料載入:透過單一的 load_dataset 函數,使用者可忽略底層儲存格式,載入資料集。
  • 資料評估FIDEvaluator 提供一種簡化的方式,用於將預測結果與資料集進行對比評估。
  • 可擴充性:系統設計支援使用者輕鬆新增新資料欄位(例如,向現有資料集新增 Canny 圖像),以適應不同模型的需求。

適用對象

專為處理大型多模態資料的 AI 研究人員與開發者設計,包含影像、影片、2D/3D 方框、2D/3D 點,以及使用 LeRobot 資料集的使用者。

主要亮點

  • 統一工作流程:將整理、打包、載入與評估整合至一個系統中。
  • 多格式支援:相容 File、LMDB、Pickle 與 LeRobot 資料集。
  • 高效率:在大規模處理過程中優化速度與記憶體效率。
  • 簡單 API:僅需一行程式碼即可完成資料集的載入與評估。

相關

  • 專案
  • 專案
  • 專案
  • 專案