apple-aiml-research/ml-4m
4M: Massively Multimodal Masked Modeling
解決的問題
4M 提供了一個用於訓練「任意到任意」多模態基礎模型的框架。它解決了將 AI 模型擴展以在單一架構中處理數十種不同模態與任務的挑戰,從而實現跨多種資料類型之間的靈活生成與遷移。
工作原理
該框架結合使用了分詞與遮罩建模來處理多樣化的模態。透過將不同資料類型轉換為標記,模型可以被訓練以預測被遮罩的標記,從而學習在各種模態間通用的表示。這使得模型能夠執行諸如 RGB 到所有模態的生成(從單張 RGB 圖像生成多種模態)或文字到所有模態的生成(從文字生成多種模態)等任務。
適用對象
此專案專為從事多模態基礎模型的 AI 研究人員與開發者設計,尤其適合對任意模態間生成、視覺任務以及可擴展的多模態訓練感興趣的人群。
主要亮點
- 任意模態間生成能力:支援數十種模態與任務之間的生成。
- 可擴展架構:提供從 198M 到 2.8B 參數的模型(4M-B、4M-L、4M-XL)。
- 多樣模態支援:包含 RGB、深度、法線、邊緣、語意分割、CLIP、DINOv2、ImageBind、SAM 實例與 3D 人體姿態的分詞器。
- 專用變體:提供文字到影像專用模型與超解析度模型。
- 開源:透過 Hugging Face Hub 提供訓練框架與預訓練檢查點。
相關
- 專案
- 專案
- 專案
- 專案