microsoft/unilm
Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities
解決的問題
此倉儲提供一個全面的基礎模型與架構集合,旨在實現「大融合」——在多樣任務、100+ 種語言,以及文字、視覺、語音、文件佈局等多模態上進行大規模自監督預訓練。
如何運作
本專案實作了多種專業架構與模型:
- 基礎架構:包含用於通用基礎模型開發的 TorchScale,可將 Transformer 擴展至 1,000+ 層的 DeepNet,以及可擴展的稀疏專家混合(X-MoE)。
- 模型創新:包含 1-bit Transformer 的 BitNet、Transformer 的後繼者 RetNet,以及可處理高達 10 億個 token 的 LongNet。
- 模態專用模型:
- 語言:用於統一理解與生成的 UniLM,以及用於快速、小規模模型的 MiniLM。
- 視覺:用於自監督影像與文件影像預訓練的 BEiT 與 DiT。
- 語音:用於全棧語音任務的 WavLM,以及基於神經編碼器的 TTS 模型 VALL-E。
- 多模態:用於文件 AI(文字 + 佈局 + 圖像)的 LayoutLM 系列,以及用於多模態大語言模型的 Kosmos 系列。
適用對象
尋找先進預訓練基礎模型、可擴展 Transformer 架構,或用於多模態與多語言處理的專用工具的 AI 研究人員與開發者。
主要亮點
- 跨模態彈性:支援單一或組合模型中的文字、影像、音訊與佈局/格式。
- 架構可擴展性:研究極深架構(DeepNet)與極長序列(LongNet)。
- 效率導向:包含 1-bit 量化(BitNet)與知識蒸餾(MiniLLM)。
- 文件 AI 領先:提供豐富的模型套件(LayoutLM、MarkupLM、XDoc),用於理解視覺豐富的文件。
相關
- 專案
- 專案
- 專案
- 專案
- 專案