HITsz-TMG/Uni-MoE

Uni-MoE: Lychee's Large Multimodal Model Family.

해결하는 문제

Uni-MoE는 특정 도메인의 성능을 희생하지 않고 여러 모달리티(오미모달리티)를 이해하고 생성할 수 있는 단일 통합 모델을 구축하는 도전 과제를 해결합니다. 텍스트, 이미지, 음성, 음악과 같은 다양한 입력을 동시에 처리할 때 흔히 발생하는 데이터 불균형과 작업 간 충돌을 극복하는 것을 목표로 합니다.

작동 방식

이 프로젝트는 Mixture-of-Experts (MoE) 아키텍처를 활용하여 다양한 버전에서 기능을 확장합니다.

  • Uni-MoE 2.0: Qwen2.5-7B 밀도형 아키텍처를 기반으로 하며, 동적 용량 MoE 설계, 반복적 강화를 포함한 단계적 훈련 전략, 그리고 정교하게 구성된 다중 모달 데이터 매칭을 통해 이미지, 텍스트, 음성의 크로스모달 및 트리모달 이해 및 생성을 가능하게 합니다.
  • Uni-MoE-Audio: Top-P 샘플링 기반의 동적 용량 라우팅 메커니즘을 사용하여 적응형 전문가 할당을 구현하고, 공유되는 보편적 표현과 도메인별 동적 전문가를 분리하는 하이브리드 전문가 설계를 채택합니다. 음성 클론, TTS부터 텍스트-음악 생성, 비디오-음악 생성에 이르기까지 다양한 작업을 처리하기 위한 3단계 훈련 커리큘럼을 사용합니다.
  • Uni-MoE 1.0: 3단계 프로세스를 사용합니다. 먼저 모달리티를 통일된 언어 공간에 매핑하는 연결 요소를 구축하고, 다음으로 모달리티별 전문가를 개발한 후, 마지막으로 이를 LLM에 통합하고 혼합된 다중 모달 데이터를 기반으로 LoRA를 통해 정교화합니다.

대상 사용자

오미모달 AI, 유니버설 오디오 생성, 확장 가능한 다중 모달 LLM 개발에 종사하는 연구자 및 개발자로, 텍스트, 시각, 오디오 간의 추론과 생성이 가능한 모델이 필요한 분들입니다.

주요 특징

  • 오미모달 기능: 텍스트, 이미지, 음성 등을 포함한 10개 이상의 모달리티에서 이해 및 생성을 지원합니다.
  • 동적 MoE: 입력 모달리티에 따라 계산을 최적화하는 적응형 전문가 할당을 사용합니다.
  • 통합 오디오 생성: 오디오 버전은 하나의 모델에서 음성과 음악 생성을 통합한 최초의 모델입니다.
  • 확장 가능한 훈련: 전문가 수준과 모달리티 수준에서 병렬 처리가 가능한 분산 MoE 모듈을 지원합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트