microsoft/unilm
Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities
해결하는 문제
이 리포지토리는 다양한 작업, 언어(100개 이상), 모달리티(텍스트, 비전, 음성, 문서 레이아웃 포함)에 걸쳐 대규모 자기지도 사전 훈련을 실현하는 '빅 컨버전스(Big Convergence)'를 목표로 하는 포괄적인 기초 모델 및 아키텍처 모음입니다.
작동 방식
이 프로젝트는 다양한 전문 아키텍처와 모델을 구현합니다:
- 기초 아키텍처: 일반적인 기초 모델 개발을 위한 TorchScale, 1,000개 이상의 레이어로 확장 가능한 Transformer를 위한 DeepNet, 확장 가능한 희소 Mixture-of-Experts를 위한 X-MoE 포함.
- 모델 혁신: 1비트 Transformer인 BitNet, Transformer의 후속 모델인 RetNet, 최대 10억 토큰까지 처리 가능한 LongNet 포함.
- 모달리티별 모델:
- 언어: 통합 이해 및 생성을 위한 UniLM, 빠르고 소규모 모델을 위한 MiniLM.
- 비전: 자기지도 이미지 및 문서 이미지 사전 훈련을 위한 BEiT 및 DiT.
- 음성: 전체 스택 음성 작업을 위한 WavLM, 신경 코덱 기반 TTS를 위한 VALL-E.
- 멀티모달: 문서 AI(텍스트 + 레이아웃 + 이미지)를 위한 LayoutLM 시리즈, 멀티모달 LLM을 위한 Kosmos 시리즈.
대상 사용자
최신 사전 훈련된 기초 모델, 확장 가능한 Transformer 아키텍처, 또는 멀티모달 및 다국어 처리를 위한 전용 도구를 찾는 AI 연구자 및 개발자.
주요 특징
- 다중 모달 유연성: 단일 또는 결합 모델에서 텍스트, 이미지, 오디오, 레이아웃/포맷을 지원.
- 아키텍처 확장성: 극한의 깊이(DeepNet) 및 극한의 시퀀스 길이(LongNet)에 대한 연구.
- 효율성 중심: 1비트 양자화(BitNet) 및 지식 증류(MiniLLM) 포함.
- 문서 AI 리더십: 시각적으로 풍부한 문서 이해를 위한 포괄적인 모델 세트(LayoutLM, MarkupLM, XDoc).
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트