HITsz-TMG/Uni-MoE

Uni-MoE: Lychee's Large Multimodal Model Family.

解决的问题

Uni-MoE 解决了构建单一统一模型以跨多种模态(全模态)进行理解与生成的挑战,同时不牺牲任何特定领域的性能。它旨在克服在同时处理文本、图像、语音和音乐等多样化输入时通常出现的数据不平衡和任务冲突问题。

工作原理

该项目采用 Mixture-of-Experts(MoE)架构,以在不同版本中扩展能力:

  • Uni-MoE 2.0:基于 Qwen2.5-7B 密集架构,采用动态容量 MoE 设计、包含迭代强化的渐进式训练策略,以及精心筛选的多模态数据匹配,实现对图像、文本和语音的跨模态与三模态理解与生成。
  • Uni-MoE-Audio:采用基于 Top-P 采样的动态容量路由机制,实现自适应专家分配,并采用混合专家设计,将共享的通用表示与领域特定的动态专家分离。使用三阶段训练课程,处理从语音克隆、TTS 到文本到音乐、视频到音乐的各种任务。
  • Uni-MoE 1.0:采用三阶段流程:首先构建连接器,将模态映射到统一语言空间;然后开发模态特定专家;最后将这些专家整合到 LLM 中,并在混合多模态数据上通过 LoRA 进行微调。

适用人群

从事全模态 AI、通用音频生成和可扩展多模态大模型的研究人员和开发者,需要一个能够在文本、视觉和音频之间进行推理与生成的模型。

主要亮点

  • 全模态能力:支持十多种模态的理解与生成,包括文本、图像和语音。
  • 动态 MoE:采用自适应专家分配,根据输入模态优化计算。
  • 统一音频生成:Audio 版本是首个在单一模型中统一实现语音与音乐生成的模型。
  • 可扩展训练:支持分布式 MoE 模块,可在专家和模态层面实现并行处理。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目