inclusionAI/LLaDA2.X
LLaDA2.0 is the diffusion language model series developed by InclusionAI team, Ant Group.
解決する課題
LLaDA2.Xは、拡散ベースのテキスト生成を1000億パラメータレベルまでスケールアップするように設計された一連の離散拡散大規模言語モデル(dLLM)であり、推論速度とアーキテクチャの面における従来の自己回帰モデルの制限を克服します。
仕組み
このプロジェクトは、言語モデリングのための離散拡散プロセスを実装しています。Mixture-of-Experts (MoE) アーキテクチャを利用してモデルサイズをスケールアップしています(LLaDA2.0-flashバリアントでは最大100Bパラメータ)。効率を向上させるために、並列デコーディングメカニズムと、KV-Cacheの再利用およびブロックレベルの並列デコーディングをサポートするdInferおよびSGLangに基づくカスタム推論エンジンを採用しています。
対象者
複雑な指示への追従やコード生成タスクを大規模に処理できる高性能なテキスト生成モデルを必要とする研究者や開発者、特に標準的な自己回帰LLMの代替案を探している方に適しています。
ハイライト
- 100Bパラメータスケール: 1000億パラメータに到達した初の拡散言語モデル。
- 推論加速: Confidence-Aware Parallel (CAP) デコーディングを使用して、最大535 tokens/sを達成。
- MoEアーキテクチャ: スケールアップしながらパフォーマンスを維持するためにMixture-of-Expertsを使用。
- オープンソース: Hugging Faceでモデルの重みとトレーニングコードを完全にオープンソースとして提供。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト