ML-GSAI/LLaDA
Official PyTorch implementation for "Large Language Diffusion Models"
解決的問題
LLaDA 解決了這樣一個假設,即高級大語言模型 (LLM) 能力(如上下文學習和指令遵循)僅與自回歸(預測下一個 token)架構綁定。它探索了掩碼擴散模型在大規模語言生成方面的極限。
工作原理
與預測序列中下一個 token 的標準 LLM 不同,LLaDA 是一個掩碼擴散模型。它使用 Transformer 架構,但採用了一種機率建模方法,即學習從掩碼序列中恢復原始 token。在訓練期間,它使用一個在 0 到 1 之間隨機變化的掩碼率,這使其訓練目標成為模型分佈的負對數似然的上界,從而將其轉變為一個生成模型。在推理過程中,它透過重掩碼 (remasking) 過程迭代地優化序列。
適用對象
對替代 LLM 架構感興趣的研究人員和開發人員,特別是那些正在探索將基於擴散的語言建模作為自回歸模型替代方案的人。
亮點
- 規模:一個從頭開始訓練的 8B 參數模型,在性能上可以媲美 LLaMA3 8B。
- 架構靈活性:使用標準的 Transformer 架構,不需要將時間 $t$ 作為輸入。
- MoE 變體:包括 LLaDA-MoE,這是第一個使用混合專家 (Mixture-of-Experts) 架構從頭開始預訓練的擴散語言模型。
- 多模態擴展:LLaDA-V 將基於擴散的方法擴展到了視覺-語言建模。
- 效率提升:iLLaDA 版本同時提高了基準測試性能和生成效率。
相關
- 專案
- 專案
- 專案
- 專案
- Dispatch