apple-aiml-research/ml-4m
4M: Massively Multimodal Masked Modeling
解决的问题
4M 提供了一个用于训练「任意到任意」多模态基础模型的框架。它解决了将 AI 模型扩展以在单一架构中处理数十种不同模态和任务的挑战,从而实现跨多种数据类型之间的灵活生成和迁移。
工作原理
该框架结合使用了分词和掩码建模来处理多样化的模态。通过将不同数据类型转换为标记,模型可以被训练以预测被掩码的标记,从而学习在各种模态间通用的表示。这使得模型能够执行诸如 RGB 到所有模态的生成(从单张 RGB 图像生成多种模态)或文本到所有模态的生成(从文本生成多种模态)等任务。
适用人群
该项目专为从事多模态基础模型的 AI 研究人员和开发者设计,尤其适合对任意模态间生成、视觉任务以及可扩展的多模态训练感兴趣的人群。
主要亮点
- 任意模态间生成能力:支持数十种模态和任务之间的生成。
- 可扩展架构:提供从 198M 到 2.8B 参数的模型(4M-B、4M-L、4M-XL)。
- 多样模态支持:包含 RGB、深度、法线、边缘、语义分割、CLIP、DINOv2、ImageBind、SAM 实例和 3D 人体姿态的分词器。
- 专用变体:提供文本到图像专用模型和超分辨率模型。
- 开源:通过 Hugging Face Hub 提供训练框架和预训练检查点。
相关
- 项目
- 项目
- 项目
- 项目