HITsz-TMG/Uni-MoE

Uni-MoE: Lychee's Large Multimodal Model Family.

解決的問題

Uni-MoE 解決了建立單一統一模型以跨多種模態(全模態)進行理解與生成的挑戰,同時不犧牲任何特定領域的性能。它旨在克服在同時處理文本、影像、語音和音樂等多樣化輸入時通常出現的資料不平衡與任務衝突問題。

工作原理

本專案採用 Mixture-of-Experts(MoE)架構,以在不同版本中擴展能力:

  • Uni-MoE 2.0:基於 Qwen2.5-7B 密集架構,採用動態容量 MoE 設計、包含迭代強化的漸進式訓練策略,以及精心篩選的多模態資料匹配,實現對影像、文字和語音的跨模態與三模態理解與生成。
  • Uni-MoE-Audio:採用基於 Top-P 採樣的動態容量路由機制,實現自適應專家分配,並採用混合專家設計,將共享的通用表示與領域特定的動態專家分離。使用三階段訓練課程,處理從語音克隆、TTS 到文字到音樂、影片到音樂的各種任務。
  • Uni-MoE 1.0:採用三階段流程:首先建構連接器,將模態映射到統一語言空間;然後開發模態特定專家;最後將這些專家整合到 LLM 中,並在混合多模態資料上透過 LoRA 進行微調。

適用對象

從事全模態 AI、通用音訊生成與可擴展多模態大模型的研究人員與開發者,需要一個能在文字、視覺與音訊之間進行推理與生成的模型。

主要亮點

  • 全模態能力:支援十種以上模態的理解與生成,包括文字、影像與語音。
  • 動態 MoE:採用自適應專家分配,根據輸入模態優化計算。
  • 統一音訊生成:Audio 版本是首個在單一模型中統一實現語音與音樂生成的模型。
  • 可擴展訓練:支援分散式 MoE 模組,可在專家與模態層面實現平行處理。

相關

  • 專案
  • 專案
  • Dispatch
  • 專案
  • 專案