apple-aiml-research/ml-4m
4M: Massively Multimodal Masked Modeling
何を解決するか
4Mは「任意のモダリティから任意のモダリティへ」のマルチモーダル基盤モデルを訓練するためのフレームワークを提供します。一つのアーキテクチャ内で数十種類の異なるモダリティとタスクを扱えるようにAIモデルをスケーリングする課題に対処し、さまざまなデータタイプ間での柔軟な生成と転移を可能にします。
動作方法
このフレームワークは、トークン化とマスクモデル化の組み合わせを使用して多様なモダリティを処理します。異なるデータタイプをトークンに変換することで、モデルはマスクされたトークンを予測するように訓練され、さまざまなモダリティで通用する表現を学習できます。これにより、RGBからすべてのモダリティへの生成(1枚のRGB画像から複数のモダリティを生成)や、キャプションからすべてのモダリティへの生成(テキストから複数のモダリティを生成)などのタスクが可能になります。
対象ユーザー
このプロジェクトは、マルチモーダル基盤モデルに取り組むAI研究者や開発者を対象としており、特に任意のモダリティ間生成、視覚タスク、スケーラブルなマルチモーダル学習に興味がある方々に適しています。
特徴
- 任意のモダリティ間生成: 数十種類のモダリティとタスク間での生成をサポート。
- スケーラブルなアーキテクチャ: 198Mから2.8Bパラメータのモデル(4M-B、4M-L、4M-XL)を提供。
- 多様なモダリティ対応: RGB、深度、法線、エッジ、セマンティックセグメンテーション、CLIP、DINOv2、ImageBind、SAMインスタンス、3D人体ポーズのトークナイザーを含む。
- 専門モデル: テキストから画像への専用モデルとスーパーレゾリューションモデルを提供。
- オープンソース: Hugging Face Hubを通じて、トレーニングフレームワークと事前学習済みチェックポイントを公開。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト