OpenEnvision/Awesome-Multimodal-Modeling
Awesome Multimodal Modeling [Covers MLLM, UMM, and NMM]
📚 什麼是 Awesome‑Multimodal‑Modeling?
Awesome‑Multimodal‑Modeling 是一個 經過篩選、由社群維護的清單,全面調查 多模態機器學習模型 的全景——即處理多種類型資料的系統(例如影像 + 文字)。此倉儲 不包含單一模型的程式碼;相反,它將論文、模型集合與資源組織成一個清晰的分類體系,反映現代研究對多模態架構的思考方式。
🎯 目標與受眾
- 目標: 為研究人員、學生與工程師提供一個單一的參考點,了解 有哪些模型存在、它們在架構上如何不同,以及 如何找到它們的實作(通常在 Hugging Face 上)。同時,它也追蹤一份短期「綜合論文」的發布進度。
- 受眾: 任何希望理解從早期融合模型(如 CLIP)到最新 原生多模態模型(從頭訓練)的演變過程的人,以及尋找即用型模型集合的開發者。
🗂️ 清單的結構
| 部分 | 你將找到的內容 |
|---|---|
| 1️⃣ 引言與定義 | 四個模型家族的精確、以架構為核心的定義: • Traditional(2023年以前以融合為中心) • 多模態大語言模型 (MLLMs) – 預訓練視覺編碼器 + 預訓練大語言模型連結而成 • 統一多模態模型 (UMMs) – 一個單一框架,可跨模態進行理解與生成 • 原生多模態模型 (NMMs) – 從頭開始在所有模態上訓練(早期融合或後期融合) |
| 2️⃣ 傳統多模態模型 | 關於多模態表示、對齊與預訓練的論文(例如 CLIP、ALIGN、ViLBERT、BLIP) |
| 3️⃣ MLLMs | 基於所用視覺適配器的分類(MLP 投影器、Q‑Former、交叉注意力、混合);列出 LLaVA、Qwen‑VL、InternVL、MiniCPM‑V、CogVLM 等知名模型 |
| 4️⃣ 統一多模態模型 (UMMs) | 按生成範式(基於擴散、自回歸、混合)和「任意到任意」能力進行細分 |
| 5️⃣ 原生多模態模型 (NMMs) | 設計分析、縮放定律討論,以及具體的早期融合(如 Emu3)和後期融合示例 |
| 6️⃣ 閉源模型 | 2023–2026 年的專有多模態系統時序列表 |
| 7️⃣ 資源 | 相關 awesome 清單、綜合簡報、程式碼倉儲與工具連結 |
🔧 如何貢獻
- 歡迎 PR – 倉儲使用簡單的驗證規則集(條目必須有可靠來源、符合分類體系、格式一致)。請參閱 How to Contribute 部分取得條目範本。
- 模型動物園 – 維護者還托管了兩個 Hugging Face 集合(UMM Zoo 和 NMM Zoo),可直接連結到開源實作。
📢 最新動態(截至 2026 年 Q3)
- 在 Hugging Face 上發布了 兩個新的模型集合:Unified Multimodal Model Zoo 和 Native Multimodal Model Zoo。
- 2026 年 4 月發布後,一天內獲得 100 ⭐。
- 一份基於此處定義分類的 全面綜合論文 即將發布。
📚 為何重要
多模態 AI 發展迅速,論文中常使用重疊的術語(例如「多模態 LLM」、「統一模型」)。此清單 標準化了術語 並 突顯對研究與產品開發至關重要的架構差異:
- 理解 vs. 生成 能力
- 模型是否 複用預訓練骨幹網路 或 從頭訓練
- 融合策略(早期 vs. 後期)及其對可擴展性之影響
擁有單一、結構良好的參考資源可節省時間、減少混淆,並幫助新手為自己的使用情境選擇合適的模型家族。
📄 許可證
該清單採用 CC0 1.0(公共領域)許可證發布,任何人可自由複製、改編或重新分發,無任何限制。
相關
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch