OpenEnvision/Awesome-Multimodal-Modeling

Awesome Multimodal Modeling [Covers MLLM, UMM, and NMM]

📚 什麼是 Awesome‑Multimodal‑Modeling

Awesome‑Multimodal‑Modeling 是一個 經過篩選、由社群維護的清單,全面調查 多模態機器學習模型 的全景——即處理多種類型資料的系統(例如影像 + 文字)。此倉儲 不包含單一模型的程式碼;相反,它將論文、模型集合與資源組織成一個清晰的分類體系,反映現代研究對多模態架構的思考方式。


🎯 目標與受眾

  • 目標: 為研究人員、學生與工程師提供一個單一的參考點,了解 有哪些模型存在它們在架構上如何不同,以及 如何找到它們的實作(通常在 Hugging Face 上)。同時,它也追蹤一份短期「綜合論文」的發布進度。
  • 受眾: 任何希望理解從早期融合模型(如 CLIP)到最新 原生多模態模型(從頭訓練)的演變過程的人,以及尋找即用型模型集合的開發者。

🗂️ 清單的結構

部分 你將找到的內容
1️⃣ 引言與定義 四個模型家族的精確、以架構為核心的定義:
Traditional(2023年以前以融合為中心)
多模態大語言模型 (MLLMs) – 預訓練視覺編碼器 + 預訓練大語言模型連結而成
統一多模態模型 (UMMs) – 一個單一框架,可跨模態進行理解與生成
原生多模態模型 (NMMs) – 從頭開始在所有模態上訓練(早期融合或後期融合)
2️⃣ 傳統多模態模型 關於多模態表示、對齊與預訓練的論文(例如 CLIP、ALIGN、ViLBERT、BLIP)
3️⃣ MLLMs 基於所用視覺適配器的分類(MLP 投影器、Q‑Former、交叉注意力、混合);列出 LLaVA、Qwen‑VL、InternVL、MiniCPM‑V、CogVLM 等知名模型
4️⃣ 統一多模態模型 (UMMs) 按生成範式(基於擴散、自回歸、混合)和「任意到任意」能力進行細分
5️⃣ 原生多模態模型 (NMMs) 設計分析、縮放定律討論,以及具體的早期融合(如 Emu3)和後期融合示例
6️⃣ 閉源模型 2023–2026 年的專有多模態系統時序列表
7️⃣ 資源 相關 awesome 清單、綜合簡報、程式碼倉儲與工具連結

🔧 如何貢獻

  • 歡迎 PR – 倉儲使用簡單的驗證規則集(條目必須有可靠來源、符合分類體系、格式一致)。請參閱 How to Contribute 部分取得條目範本。
  • 模型動物園 – 維護者還托管了兩個 Hugging Face 集合(UMM Zoo 和 NMM Zoo),可直接連結到開源實作。

📢 最新動態(截至 2026 年 Q3)

  • 在 Hugging Face 上發布了 兩個新的模型集合Unified Multimodal Model ZooNative Multimodal Model Zoo
  • 2026 年 4 月發布後,一天內獲得 100 ⭐
  • 一份基於此處定義分類的 全面綜合論文 即將發布。

📚 為何重要

多模態 AI 發展迅速,論文中常使用重疊的術語(例如「多模態 LLM」、「統一模型」)。此清單 標準化了術語突顯對研究與產品開發至關重要的架構差異

  • 理解 vs. 生成 能力
  • 模型是否 複用預訓練骨幹網路從頭訓練
  • 融合策略(早期 vs. 後期)及其對可擴展性之影響

擁有單一、結構良好的參考資源可節省時間、減少混淆,並幫助新手為自己的使用情境選擇合適的模型家族。


📄 許可證

該清單採用 CC0 1.0(公共領域)許可證發布,任何人可自由複製、改編或重新分發,無任何限制。

相關