open-gigaai/giga-datasets
GigaDatasets: A Unified and Lightweight Framework for Data Processing, Curation, and Visualization
何を解決するか
GigaDatasets は、AIトレーニングおよび推論で使用される大規模データセットを管理するための統合的で軽量なフレームワークを提供します。データのキュレーション、パッケージ化、ロード、評価という複雑なプロセスを簡素化し、さまざまなデータ形式や構造間での一貫性を確保します。
どう動作するか
このフレームワークは、データパイプラインの異なる段階に対応する専用ツールのセットで動作します:
- データパッケージ化:
PklWriter、FileWriter、LmdbWriterなどの Writer クラスを使用して、画像やJSON形式のアノテーションなどの非構造化された生データを構造的で効率的な形式に変換します。 - データロード:1つの
load_dataset関数で、基盤となるストレージ形式にかかわらずデータセットをロードできます。 - データ評価:
FIDEvaluatorにより、予測結果をデータセットに対して簡潔に評価できます。 - 拡張性:新しいデータフィールド(例:既存のデータセットにCannyマップを追加)を簡単に追加できるように設計されており、さまざまなモデルの要件に対応できます。
対象ユーザー
画像、動画、2D/3Dボックス、2D/3Dポイントなどの大規模マルチモーダルデータを扱うAI研究者や開発者、および LeRobot データセットを使用するユーザー向けに設計されています。
特徴
- 統合ワークフロー:キュレーション、パッケージ化、ロード、評価を1つのシステムに統合。
- マルチフォーマット対応:File、LMDB、Pickle、LeRobot データセットと互換性あり。
- 高パフォーマンス:大規模処理における速度とメモリ効率を最適化。
- シンプルなAPI:1行のコードでデータセットのロードと評価が可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト