OpenEnvision/Awesome-Multimodal-Modeling
Awesome Multimodal Modeling [Covers MLLM, UMM, and NMM]
📚 什么是 Awesome‑Multimodal‑Modeling?
Awesome‑Multimodal‑Modeling 是一个 经过筛选、由社区维护的列表,全面调查 多模态机器学习模型 的全景——即处理多种类型数据的系统(例如图像 + 文本)。该仓库 不包含单个模型的代码;相反,它将论文、模型集合和资源组织成一个清晰的分类体系,反映了现代研究对多模态架构的思考方式。
🎯 目标与受众
- 目标: 为研究人员、学生和工程师提供一个单一的参考点,了解 有哪些模型存在、它们在架构上如何不同,以及 如何找到它们的实现(通常在 Hugging Face 上)。同时,它还追踪一份短期“综述论文”的发布进度。
- 受众: 任何希望理解从早期融合模型(如 CLIP)到最新 原生多模态模型(从头训练)的演变过程的人,以及寻找即用型模型集合的开发者。
🗂️ 列表的结构
| 部分 | 你将找到的内容 |
|---|---|
| 1️⃣ 引言与定义 | 四个模型家族的精确、以架构为核心的定义: • Traditional(2023年以前以融合为中心) • 多模态大语言模型 (MLLMs) – 预训练视觉编码器 + 预训练大语言模型连接而成 • 统一多模态模型 (UMMs) – 一个单一框架,可跨模态进行理解和生成 • 原生多模态模型 (NMMs) – 从头开始在所有模态上训练(早期融合或后期融合) |
| 2️⃣ 传统多模态模型 | 关于多模态表示、对齐和预训练的论文(例如 CLIP、ALIGN、ViLBERT、BLIP) |
| 3️⃣ MLLMs | 基于所用视觉适配器的分类(MLP 投影器、Q‑Former、交叉注意力、混合);列出 LLaVA、Qwen‑VL、InternVL、MiniCPM‑V、CogVLM 等知名模型 |
| 4️⃣ 统一多模态模型 (UMMs) | 按生成范式(基于扩散、自回归、混合)和“任意到任意”能力进行细分 |
| 5️⃣ 原生多模态模型 (NMMs) | 设计分析、缩放定律讨论,以及具体的早期融合(如 Emu3)和后期融合示例 |
| 6️⃣ 闭源模型 | 2023–2026 年的专有多模态系统时序列表 |
| 7️⃣ 资源 | 相关 awesome 列表、综述幻灯片、代码仓库和工具链接 |
🔧 如何贡献
- 欢迎 PR – 仓库使用简单的验证规则集(条目必须有可靠来源、符合分类体系、格式一致)。请参阅 How to Contribute 部分获取条目模板。
- 模型动物园 – 维护者还托管了两个 Hugging Face 集合(UMM Zoo 和 NMM Zoo),可直接链接到开源实现。
📢 最新动态(截至 2026 年 Q3)
- 在 Hugging Face 上发布了 两个新的模型集合:Unified Multimodal Model Zoo 和 Native Multimodal Model Zoo。
- 2026 年 4 月发布后,一天内获得 100 ⭐。
- 一份基于此处定义分类的 全面综述论文 即将发布。
📚 为何重要
多模态 AI 发展迅速,论文中常使用重叠的术语(例如“多模态 LLM”、“统一模型”)。此列表 标准化了术语 并 突出了对研究和产品开发至关重要的架构差异:
- 理解 vs. 生成 能力
- 模型是否 复用预训练骨干网络 或 从头训练
- 融合策略(早期 vs. 后期)及其对可扩展性的影响
拥有一个单一、结构良好的参考资源可节省时间、减少混淆,并帮助新手为自己的用例选择合适的模型家族。
📄 许可证
该列表采用 CC0 1.0(公共领域)许可证发布,任何人可自由复制、改编或重新分发,无任何限制。
相关
- Dispatch
- Dispatch
- Dispatch
- Dispatch
- Dispatch