HITsz-TMG/Uni-MoE
Uni-MoE: Lychee's Large Multimodal Model Family.
解决的问题
Uni-MoE 解决了构建单一统一模型以跨多种模态(全模态)进行理解与生成的挑战,同时不牺牲任何特定领域的性能。它旨在克服在同时处理文本、图像、语音和音乐等多样化输入时通常出现的数据不平衡和任务冲突问题。
工作原理
该项目采用 Mixture-of-Experts(MoE)架构,以在不同版本中扩展能力:
- Uni-MoE 2.0:基于 Qwen2.5-7B 密集架构,采用动态容量 MoE 设计、包含迭代强化的渐进式训练策略,以及精心筛选的多模态数据匹配,实现对图像、文本和语音的跨模态与三模态理解与生成。
- Uni-MoE-Audio:采用基于 Top-P 采样的动态容量路由机制,实现自适应专家分配,并采用混合专家设计,将共享的通用表示与领域特定的动态专家分离。使用三阶段训练课程,处理从语音克隆、TTS 到文本到音乐、视频到音乐的各种任务。
- Uni-MoE 1.0:采用三阶段流程:首先构建连接器,将模态映射到统一语言空间;然后开发模态特定专家;最后将这些专家整合到 LLM 中,并在混合多模态数据上通过 LoRA 进行微调。
适用人群
从事全模态 AI、通用音频生成和可扩展多模态大模型的研究人员和开发者,需要一个能够在文本、视觉和音频之间进行推理与生成的模型。
主要亮点
- 全模态能力:支持十多种模态的理解与生成,包括文本、图像和语音。
- 动态 MoE:采用自适应专家分配,根据输入模态优化计算。
- 统一音频生成:Audio 版本是首个在单一模型中统一实现语音与音乐生成的模型。
- 可扩展训练:支持分布式 MoE 模块,可在专家和模态层面实现并行处理。
相关
- 项目
- 项目
- Dispatch
- 项目
- 项目