facebookresearch/multimodal

TorchMultimodal is a PyTorch library for training state-of-the-art multimodal multi-task models at scale.

解決的問題

TorchMultimodal 提供了一個用於訓練最先進多模態模型的擴展 PyTorch 函式庫。它透過提供模組化構建塊、常用配置的預訓練權重以及各種多模態任務的範例腳本,簡化了構建這些模型的過程。

工作原理

該函式庫由幾個關鍵組件組成:

  • 模組化構建塊:包括可以組合以建立新架構的融合層、損失函數、數據集與工具程式。
  • 模型類別:提供流行多模態模型的即用型實作,例如 ALBEF、BLIP-2、CLIP、CoCa、DALL-E 2、FLAVA、MAE/Audio MAE 與 MDETR。
  • Diffusion Labs:專門為構建擴散模型而設計的組件部分。
  • 數據轉換:包含來自 CLIP、FLAVA 與 MAE 等流行模型的常用數據轉換,以確保數據一致性。
  • 範例:用於檢索、視覺問答、短語落地(phrase grounding)與文本生成影片等任務的實用腳本。

適用對象

該函式庫專為希望大規模訓練、微調或評估多模態模型的研究人員與開發人員設計,可將其作為研究的基準或未來工作的起點。

亮點

  • 廣泛的模型庫:支援包括 CLIP、BLIP-2 與 DALL-E 2 在內的廣泛多模態架構。
  • 可組合架構:提供通用的構建塊,如 ViT 與 BERT 編碼器、Transformer 編碼器/解碼器以及各種融合模組。
  • 預訓練權重:為常用模型的標準配置提供預訓練權重。
  • 交叉任務:支援文本生成影片與視覺問答等多樣化任務。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案