HITsz-TMG/Uni-MoE

Uni-MoE: Lychee's Large Multimodal Model Family.

何を解決するか

Uni-MoEは、特定のドメインでのパフォーマンスを犠牲にすることなく、複数のモダリティ(オムニモダリティ)を理解・生成できる単一の統合モデルを構築する課題に対処します。テキスト、画像、音声、音楽などの多様な入力を同時に処理する際によく発生するデータの不均衡やタスクの衝突を克服することを目指しています。

どう動くか

このプロジェクトは、Mixture-of-Experts (MoE) アーキテクチャを活用して、さまざまなバージョンで能力をスケーリングしています。

  • Uni-MoE 2.0: Qwen2.5-7B の密度型アーキテクチャに基づき、動的容量の MoE デザイン、反復的強化を伴う段階的トレーニング戦略、およびカスタマイズされたマルチモーダルデータマッチングを採用し、画像、テキスト、音声のクロスモーダルおよびトリモーダルな理解・生成を可能にしています。
  • Uni-MoE-Audio: Top-P サンプリングに基づく動的容量ルーティング機構を用いて、適応的なエキスパート割り当てを実現し、共有される普遍的な表現とドメイン固有の動的エキスパートを分離するハイブリッドエキスパート設計を採用しています。音声クローン、TTS からテキスト音楽生成、ビデオ音楽生成までをカバーする三段階トレーニングカリキュラムを使用しています。
  • Uni-MoE 1.0: 三段階プロセスを採用しています。まず、モダリティを統一された言語空間にマッピングするコネクタを構築し、次にモダリティ固有のエキスパートを開発し、最後にこれらを LLM に統合し、混合マルチモーダルデータ上で LoRA を用いて微調整します。

対象ユーザー

オムニモーダルAI、ユニバーサル音声生成、スケーラブルなマルチモーダルLLMに取り組む研究者や開発者で、テキスト、視覚、音声の across で推論・生成が可能なモデルが必要な方々。

主な特徴

  • オムニモーダル機能: テキスト、画像、音声を含む10種類以上のモダリティでの理解・生成をサポートしています。
  • 動的MoE: 入力モダリティに応じて計算を最適化する適応的エキスパート割り当てを採用しています。
  • 統一された音声生成: Audioバージョンは、1つのモデルで音声と音楽の生成を統合した最初のモデルです。
  • スケーラブルなトレーニング: エキスパートレベルおよびモダリティレベルで並列処理が可能な分散MoEモジュールをサポートしています。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト