microsoft/unilm

Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities

해결하는 문제

이 리포지토리는 다양한 작업, 언어(100개 이상), 모달리티(텍스트, 비전, 음성, 문서 레이아웃 포함)에 걸쳐 대규모 자기지도 사전 훈련을 실현하는 '빅 컨버전스(Big Convergence)'를 목표로 하는 포괄적인 기초 모델 및 아키텍처 모음입니다.

작동 방식

이 프로젝트는 다양한 전문 아키텍처와 모델을 구현합니다:

  • 기초 아키텍처: 일반적인 기초 모델 개발을 위한 TorchScale, 1,000개 이상의 레이어로 확장 가능한 Transformer를 위한 DeepNet, 확장 가능한 희소 Mixture-of-Experts를 위한 X-MoE 포함.
  • 모델 혁신: 1비트 Transformer인 BitNet, Transformer의 후속 모델인 RetNet, 최대 10억 토큰까지 처리 가능한 LongNet 포함.
  • 모달리티별 모델:
    • 언어: 통합 이해 및 생성을 위한 UniLM, 빠르고 소규모 모델을 위한 MiniLM.
    • 비전: 자기지도 이미지 및 문서 이미지 사전 훈련을 위한 BEiT 및 DiT.
    • 음성: 전체 스택 음성 작업을 위한 WavLM, 신경 코덱 기반 TTS를 위한 VALL-E.
    • 멀티모달: 문서 AI(텍스트 + 레이아웃 + 이미지)를 위한 LayoutLM 시리즈, 멀티모달 LLM을 위한 Kosmos 시리즈.

대상 사용자

최신 사전 훈련된 기초 모델, 확장 가능한 Transformer 아키텍처, 또는 멀티모달 및 다국어 처리를 위한 전용 도구를 찾는 AI 연구자 및 개발자.

주요 특징

  • 다중 모달 유연성: 단일 또는 결합 모델에서 텍스트, 이미지, 오디오, 레이아웃/포맷을 지원.
  • 아키텍처 확장성: 극한의 깊이(DeepNet) 및 극한의 시퀀스 길이(LongNet)에 대한 연구.
  • 효율성 중심: 1비트 양자화(BitNet) 및 지식 증류(MiniLLM) 포함.
  • 문서 AI 리더십: 시각적으로 풍부한 문서 이해를 위한 포괄적인 모델 세트(LayoutLM, MarkupLM, XDoc).

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트