microsoft/unilm

Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities

解決的問題

此倉儲提供一個全面的基礎模型與架構集合,旨在實現「大融合」——在多樣任務、100+ 種語言,以及文字、視覺、語音、文件佈局等多模態上進行大規模自監督預訓練。

如何運作

本專案實作了多種專業架構與模型:

  • 基礎架構:包含用於通用基礎模型開發的 TorchScale,可將 Transformer 擴展至 1,000+ 層的 DeepNet,以及可擴展的稀疏專家混合(X-MoE)。
  • 模型創新:包含 1-bit Transformer 的 BitNet、Transformer 的後繼者 RetNet,以及可處理高達 10 億個 token 的 LongNet。
  • 模態專用模型
    • 語言:用於統一理解與生成的 UniLM,以及用於快速、小規模模型的 MiniLM。
    • 視覺:用於自監督影像與文件影像預訓練的 BEiT 與 DiT。
    • 語音:用於全棧語音任務的 WavLM,以及基於神經編碼器的 TTS 模型 VALL-E。
    • 多模態:用於文件 AI(文字 + 佈局 + 圖像)的 LayoutLM 系列,以及用於多模態大語言模型的 Kosmos 系列。

適用對象

尋找先進預訓練基礎模型、可擴展 Transformer 架構,或用於多模態與多語言處理的專用工具的 AI 研究人員與開發者。

主要亮點

  • 跨模態彈性:支援單一或組合模型中的文字、影像、音訊與佈局/格式。
  • 架構可擴展性:研究極深架構(DeepNet)與極長序列(LongNet)。
  • 效率導向:包含 1-bit 量化(BitNet)與知識蒸餾(MiniLLM)。
  • 文件 AI 領先:提供豐富的模型套件(LayoutLM、MarkupLM、XDoc),用於理解視覺豐富的文件。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案