microsoft/unilm
Large-scale Self-supervised Pre-training Across Tasks, Languages, and Modalities
何を解決するか
このリポジトリは、テキスト、ビジョン、音声、マルチモーダルタスクにわたる大規模な自己教師付き事前学習「The Big Convergence」を実現するための、包括的な基礎モデルとアーキテクチャのコレクションです。
仕組み
このプロジェクトは、多様な専門的アーキテクチャとモデルを実装しています:
- 基礎アーキテクチャ:一般の基礎モデル開発向けの TorchScale、1,000層以上のTransformerをスケーリングする DeepNet、スケーラブルなスパースMixture-of-Experts(X-MoE)を含みます。
- モデルの革新:1ビットTransformerである BitNet、Transformerの後継である RetNet、最大10億トークンまで処理可能な LongNet を特徴としています。
- モダリティ固有のモデル:
- 言語:統合的理解と生成向けの UniLM、高速で小規模なモデル向けの MiniLM。
- ビジョン:自己教師付き画像およびドキュメント画像事前学習向けの BEiT と DiT。
- 音声:フルスタック音声タスク向けの WavLM、神経コーデックベースTTS向けの VALL-E。
- マルチモーダル:ドキュメントAI(テキスト+レイアウト+画像)向けの LayoutLMシリーズ、マルチモーダルLLM向けの Kosmosシリーズ。
対象ユーザー
最先端の事前学習された基礎モデル、スケーラブルなTransformerアーキテクチャ、またはマルチモーダル・マルチリンガル処理向けの専門ツールを探しているAI研究者および開発者。
主な特徴
- マルチモーダルの柔軟性:単一または組み合わせモデルでテキスト、画像、音声、レイアウト/フォーマットをサポート。
- アーキテクチャのスケーリング:極端な深さ(DeepNet)と極端なシーケンス長(LongNet)に関する研究。
- 効率性への注力:1ビット量子化(BitNet)と知識蒸留(MiniLLM)を含む。
- ドキュメントAIのリーダーシップ:視覚的に豊かなドキュメントの理解に向けた包括的なモデル群(LayoutLM、MarkupLM、XDoc)。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト