inclusionAI/LLaDA2.X
LLaDA2.0 is the diffusion language model series developed by InclusionAI team, Ant Group.
解決的問題
LLaDA2.X 是一系列離散擴散大語言模型 (dLLMs),旨在將基於擴散的文本生成擴展到 1000 億參數級別,克服了傳統自回歸模型在推理速度和架構方面的局限性。
工作原理
該專案實現了用於語言建模的離散擴散過程。它利用混合專家 (MoE) 架構來擴展模型規模(在 LLaDA2.0-flash 變體中高達 100B 參數)。為了提高效率,它採用了並行解碼機制以及基於 dInfer 和 SGLang 的定制推理引擎,支援 KV-Cache 重用和區塊級並行解碼。
適用對象
需要能夠大規模處理複雜指令遵循和程式碼生成任務的高性能文本生成模型的研究人員和開發人員,特別是那些正在尋找標準自回歸 LLM 替代方案的人。
亮點
- 100B 參數規模:首個達到 1000 億參數規模的擴散語言模型。
- 推理加速:使用置信度感知並行 (CAP) 解碼實現高達 535 tokens/s 的速度。
- MoE 架構:使用混合專家架構在擴展規模的同時保持性能。
- 開源:在 Hugging Face 上提供完全開源的模型權重和訓練程式碼。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案