open-gigaai/giga-datasets

GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization

何を解決するか

GigaDatasets は、AIトレーニングおよび推論で使用される大規模データセットを管理するための統合的で軽量なフレームワークを提供します。データのキュレーション、パッケージ化、ロード、評価という複雑なプロセスを簡素化し、さまざまなデータ形式や構造間での一貫性を確保します。

どう動作するか

このフレームワークは、データパイプラインの異なる段階に対応する専用ツールのセットで動作します:

  • データパッケージ化PklWriterFileWriterLmdbWriter などの Writer クラスを使用して、画像やJSON形式のアノテーションなどの非構造化された生データを構造的で効率的な形式に変換します。
  • データロード:1つの load_dataset 関数で、基盤となるストレージ形式にかかわらずデータセットをロードできます。
  • データ評価FIDEvaluator により、予測結果をデータセットに対して簡潔に評価できます。
  • 拡張性:新しいデータフィールド(例:既存のデータセットにCannyマップを追加)を簡単に追加できるように設計されており、さまざまなモデルの要件に対応できます。

対象ユーザー

画像、動画、2D/3Dボックス、2D/3Dポイントなどの大規模マルチモーダルデータを扱うAI研究者や開発者、および LeRobot データセットを使用するユーザー向けに設計されています。

特徴

  • 統合ワークフロー:キュレーション、パッケージ化、ロード、評価を1つのシステムに統合。
  • マルチフォーマット対応:File、LMDB、Pickle、LeRobot データセットと互換性あり。
  • 高パフォーマンス:大規模処理における速度とメモリ効率を最適化。
  • シンプルなAPI:1行のコードでデータセットのロードと評価が可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト