open-gigaai/giga-datasets
GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization
解決的問題
GigaDatasets 提供了一個統一且輕量的框架,用於管理人工智慧訓練與推論中使用的大型數據集。它簡化了資料整理、打包、載入與評估的複雜流程,確保在不同資料格式與結構之間保持一致性。
如何運作
此框架透過一系列專用工具,針對資料流程的不同階段運作:
- 資料打包:使用 Writer 類別(如
PklWriter、FileWriter和LmdbWriter)將非結構化的原始資料(如影像與 JSON 標註)轉換為結構化、高效的格式。 - 資料載入:透過單一的
load_dataset函數,使用者可忽略底層儲存格式,載入資料集。 - 資料評估:
FIDEvaluator提供一種簡化的方式,用於將預測結果與資料集進行對比評估。 - 可擴充性:系統設計支援使用者輕鬆新增新資料欄位(例如,向現有資料集新增 Canny 圖像),以適應不同模型的需求。
適用對象
專為處理大型多模態資料的 AI 研究人員與開發者設計,包含影像、影片、2D/3D 方框、2D/3D 點,以及使用 LeRobot 資料集的使用者。
主要亮點
- 統一工作流程:將整理、打包、載入與評估整合至一個系統中。
- 多格式支援:相容 File、LMDB、Pickle 與 LeRobot 資料集。
- 高效率:在大規模處理過程中優化速度與記憶體效率。
- 簡單 API:僅需一行程式碼即可完成資料集的載入與評估。
相關
- 專案
- 專案
- 專案
- 專案