microsoft/unilm
Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities
解决的问题
该仓库是一个全面的基础模型和架构集合,旨在实现「大融合」——在多种任务、100多种语言以及文本、视觉、语音和文档布局等多模态上进行大规模自监督预训练。
工作原理
该项目实现了多种专业架构和模型:
- 基础架构:包括用于通用基础模型开发的 TorchScale,用于将 Transformer 扩展至 1,000+ 层的 DeepNet,以及用于可扩展稀疏专家混合(Mixture-of-Experts)的 X-MoE。
- 模型创新:包含 1-bit Transformer 的 BitNet、Transformer 的后继者 RetNet,以及可处理高达 10 亿个 token 的 LongNet。
- 模态专用模型:
- 语言:用于统一理解与生成的 UniLM,以及用于快速、小规模模型的 MiniLM。
- 视觉:用于自监督图像和文档图像预训练的 BEiT 和 DiT。
- 语音:用于全栈语音任务的 WavLM,以及基于神经编码器的 TTS 模型 VALL-E。
- 多模态:用于文档 AI(文本 + 布局 + 图像)的 LayoutLM 系列,以及用于多模态大语言模型的 Kosmos 系列。
适用人群
寻找前沿预训练基础模型、可扩展 Transformer 架构,或用于多模态和多语言处理的专用工具的 AI 研究人员和开发者。
主要亮点
- 跨模态灵活性:支持单模型或组合模型中的文本、图像、音频和布局/格式。
- 架构可扩展性:研究极深架构(DeepNet)和极长序列(LongNet)。
- 效率优先:包含 1-bit 量化(BitNet)和知识蒸馏(MiniLLM)。
- 文档 AI 领先:提供丰富的模型套件(LayoutLM、MarkupLM、XDoc),用于理解视觉丰富的文档。
相关
- 项目
- 项目
- 项目
- 项目
- 项目