apple-aiml-research/ml-4m

4M: Massively Multimodal Masked Modeling

解決的問題

4M 提供了一個用於訓練「任意到任意」多模態基礎模型的框架。它解決了將 AI 模型擴展以在單一架構中處理數十種不同模態與任務的挑戰,從而實現跨多種資料類型之間的靈活生成與遷移。

工作原理

該框架結合使用了分詞與遮罩建模來處理多樣化的模態。透過將不同資料類型轉換為標記,模型可以被訓練以預測被遮罩的標記,從而學習在各種模態間通用的表示。這使得模型能夠執行諸如 RGB 到所有模態的生成(從單張 RGB 圖像生成多種模態)或文字到所有模態的生成(從文字生成多種模態)等任務。

適用對象

此專案專為從事多模態基礎模型的 AI 研究人員與開發者設計,尤其適合對任意模態間生成、視覺任務以及可擴展的多模態訓練感興趣的人群。

主要亮點

  • 任意模態間生成能力:支援數十種模態與任務之間的生成。
  • 可擴展架構:提供從 198M 到 2.8B 參數的模型(4M-B、4M-L、4M-XL)。
  • 多樣模態支援:包含 RGB、深度、法線、邊緣、語意分割、CLIP、DINOv2、ImageBind、SAM 實例與 3D 人體姿態的分詞器。
  • 專用變體:提供文字到影像專用模型與超解析度模型。
  • 開源:透過 Hugging Face Hub 提供訓練框架與預訓練檢查點。

相關

  • 專案
  • 專案
  • 專案
  • 專案