microsoft/unilm

Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities

何を解決するか

このリポジトリは、テキスト、ビジョン、音声、マルチモーダルタスクにわたる大規模な自己教師付き事前学習「The Big Convergence」を実現するための、包括的な基礎モデルとアーキテクチャのコレクションです。

仕組み

このプロジェクトは、多様な専門的アーキテクチャとモデルを実装しています:

  • 基礎アーキテクチャ:一般の基礎モデル開発向けの TorchScale、1,000層以上のTransformerをスケーリングする DeepNet、スケーラブルなスパースMixture-of-Experts(X-MoE)を含みます。
  • モデルの革新:1ビットTransformerである BitNet、Transformerの後継である RetNet、最大10億トークンまで処理可能な LongNet を特徴としています。
  • モダリティ固有のモデル
    • 言語:統合的理解と生成向けの UniLM、高速で小規模なモデル向けの MiniLM。
    • ビジョン:自己教師付き画像およびドキュメント画像事前学習向けの BEiT と DiT。
    • 音声:フルスタック音声タスク向けの WavLM、神経コーデックベースTTS向けの VALL-E。
    • マルチモーダル:ドキュメントAI(テキスト+レイアウト+画像)向けの LayoutLMシリーズ、マルチモーダルLLM向けの Kosmosシリーズ。

対象ユーザー

最先端の事前学習された基礎モデル、スケーラブルなTransformerアーキテクチャ、またはマルチモーダル・マルチリンガル処理向けの専門ツールを探しているAI研究者および開発者。

主な特徴

  • マルチモーダルの柔軟性:単一または組み合わせモデルでテキスト、画像、音声、レイアウト/フォーマットをサポート。
  • アーキテクチャのスケーリング:極端な深さ(DeepNet)と極端なシーケンス長(LongNet)に関する研究。
  • 効率性への注力:1ビット量子化(BitNet)と知識蒸留(MiniLLM)を含む。
  • ドキュメントAIのリーダーシップ:視覚的に豊かなドキュメントの理解に向けた包括的なモデル群(LayoutLM、MarkupLM、XDoc)。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト