ML-GSAI/LLaDA

Official PyTorch implementation for "Large Language Diffusion Models"

解決する課題

LLaDAは、インコンテキスト学習や指示への追従といった高度な大規模言語モデル(LLM)の能力が、自己回帰型(次トークン予測)アーキテクチャにのみ結びついているという仮定に対処します。また、大規模な言語生成におけるマスク拡散モデルの限界を探求します。

仕組み

シーケンス内の次のトークンを予測する標準的なLLMとは異なり、LLaDAはマスク拡散モデルです。Transformerアーキテクチャを使用していますが、マスクされたシーケンスから元のトークンを復元することを学習する確率的モデリング手法を採用しています。トレーニング中、0から1の間でランダムに変化するマスキング比率を使用しており、これによりトレーニング目的関数がモデル分布の負の対数尤度の実質的な上限となり、生成モデルへと変貌させます。推論時には、再マスキングプロセスを通じてシーケンスを反復的に洗練させます。

対象者

代替的なLLMアーキテクチャに関心のある研究者や開発者、特に自己回帰モデルの代替として拡散ベースの言語モデリングを探求している方に適しています。

ハイライト

  • スケール: ゼロからトレーニングされた8Bパラメータモデルであり、性能面でLLaMA3 8Bに匹敵します。
  • アーキテクチャの柔軟性: 時間 $t$ を入力として必要としない標準的なTransformerアーキテクチャを使用しています。
  • MoEバリアント: Mixture-of-Expertsアーキテクチャを用いてゼロから事前学習された初の拡散言語モデルであるLLaDA-MoEを含んでいます。
  • マルチモーダル拡張: LLaDA-Vは、拡散ベースのアプローチを視覚言語モデリングに拡張しています。
  • 効率の向上: iLLaDAバージョンは、ベンチマーク性能と生成効率の両方を向上させています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch