OpenEnvision/Awesome-Multimodal-Modeling

Awesome Multimodal Modeling [Covers MLLM, UMM, and NMM]

📚 什么是 Awesome‑Multimodal‑Modeling

Awesome‑Multimodal‑Modeling 是一个 经过筛选、由社区维护的列表,全面调查 多模态机器学习模型 的全景——即处理多种类型数据的系统(例如图像 + 文本)。该仓库 不包含单个模型的代码;相反,它将论文、模型集合和资源组织成一个清晰的分类体系,反映了现代研究对多模态架构的思考方式。


🎯 目标与受众

  • 目标: 为研究人员、学生和工程师提供一个单一的参考点,了解 有哪些模型存在它们在架构上如何不同,以及 如何找到它们的实现(通常在 Hugging Face 上)。同时,它还追踪一份短期“综述论文”的发布进度。
  • 受众: 任何希望理解从早期融合模型(如 CLIP)到最新 原生多模态模型(从头训练)的演变过程的人,以及寻找即用型模型集合的开发者。

🗂️ 列表的结构

部分 你将找到的内容
1️⃣ 引言与定义 四个模型家族的精确、以架构为核心的定义:
Traditional(2023年以前以融合为中心)
多模态大语言模型 (MLLMs) – 预训练视觉编码器 + 预训练大语言模型连接而成
统一多模态模型 (UMMs) – 一个单一框架,可跨模态进行理解和生成
原生多模态模型 (NMMs) – 从头开始在所有模态上训练(早期融合或后期融合)
2️⃣ 传统多模态模型 关于多模态表示、对齐和预训练的论文(例如 CLIP、ALIGN、ViLBERT、BLIP)
3️⃣ MLLMs 基于所用视觉适配器的分类(MLP 投影器、Q‑Former、交叉注意力、混合);列出 LLaVA、Qwen‑VL、InternVL、MiniCPM‑V、CogVLM 等知名模型
4️⃣ 统一多模态模型 (UMMs) 按生成范式(基于扩散、自回归、混合)和“任意到任意”能力进行细分
5️⃣ 原生多模态模型 (NMMs) 设计分析、缩放定律讨论,以及具体的早期融合(如 Emu3)和后期融合示例
6️⃣ 闭源模型 2023–2026 年的专有多模态系统时序列表
7️⃣ 资源 相关 awesome 列表、综述幻灯片、代码仓库和工具链接

🔧 如何贡献

  • 欢迎 PR – 仓库使用简单的验证规则集(条目必须有可靠来源、符合分类体系、格式一致)。请参阅 How to Contribute 部分获取条目模板。
  • 模型动物园 – 维护者还托管了两个 Hugging Face 集合(UMM Zoo 和 NMM Zoo),可直接链接到开源实现。

📢 最新动态(截至 2026 年 Q3)

  • 在 Hugging Face 上发布了 两个新的模型集合Unified Multimodal Model ZooNative Multimodal Model Zoo
  • 2026 年 4 月发布后,一天内获得 100 ⭐
  • 一份基于此处定义分类的 全面综述论文 即将发布。

📚 为何重要

多模态 AI 发展迅速,论文中常使用重叠的术语(例如“多模态 LLM”、“统一模型”)。此列表 标准化了术语突出了对研究和产品开发至关重要的架构差异

  • 理解 vs. 生成 能力
  • 模型是否 复用预训练骨干网络从头训练
  • 融合策略(早期 vs. 后期)及其对可扩展性的影响

拥有一个单一、结构良好的参考资源可节省时间、减少混淆,并帮助新手为自己的用例选择合适的模型家族。


📄 许可证

该列表采用 CC0 1.0(公共领域)许可证发布,任何人可自由复制、改编或重新分发,无任何限制。

相关