HITsz-TMG/Uni-MoE
Uni-MoE: Lychee's Large Multimodal Model Family.
解決的問題
Uni-MoE 解決了建立單一統一模型以跨多種模態(全模態)進行理解與生成的挑戰,同時不犧牲任何特定領域的性能。它旨在克服在同時處理文本、影像、語音和音樂等多樣化輸入時通常出現的資料不平衡與任務衝突問題。
工作原理
本專案採用 Mixture-of-Experts(MoE)架構,以在不同版本中擴展能力:
- Uni-MoE 2.0:基於 Qwen2.5-7B 密集架構,採用動態容量 MoE 設計、包含迭代強化的漸進式訓練策略,以及精心篩選的多模態資料匹配,實現對影像、文字和語音的跨模態與三模態理解與生成。
- Uni-MoE-Audio:採用基於 Top-P 採樣的動態容量路由機制,實現自適應專家分配,並採用混合專家設計,將共享的通用表示與領域特定的動態專家分離。使用三階段訓練課程,處理從語音克隆、TTS 到文字到音樂、影片到音樂的各種任務。
- Uni-MoE 1.0:採用三階段流程:首先建構連接器,將模態映射到統一語言空間;然後開發模態特定專家;最後將這些專家整合到 LLM 中,並在混合多模態資料上透過 LoRA 進行微調。
適用對象
從事全模態 AI、通用音訊生成與可擴展多模態大模型的研究人員與開發者,需要一個能在文字、視覺與音訊之間進行推理與生成的模型。
主要亮點
- 全模態能力:支援十種以上模態的理解與生成,包括文字、影像與語音。
- 動態 MoE:採用自適應專家分配,根據輸入模態優化計算。
- 統一音訊生成:Audio 版本是首個在單一模型中統一實現語音與音樂生成的模型。
- 可擴展訓練:支援分散式 MoE 模組,可在專家與模態層面實現平行處理。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案