facebookresearch/PhysicsLM4
Physics of Language Models: Part 4.2, Canon Layers at Scale where Synthetic Pretraining Resonates in Reality
解決的問題
本專案提供《語言模型的物理》系列的研究程式碼與資料,特別聚焦於「Canon層」的設計,以改善大型語言模型(LLM)的架構。旨在彌補合成預訓練實驗與實際應用效能之間的差距,展示特定架構變更如何提升模型容量與知識儲存能力。
作用方式
此倉儲實作了多項關鍵架構改良,並提供重現其結果的工具:
- Canon層:為基於Transformer的模型(如Llama)與線性模型(如GLA、GDN與Mamba2)實作「Canon-ABCD」與「Canon-AbCd」層。
- 模型實作:提供Hugging Face相容的模型,例如
LlamaCanon,支援QK-norm與部分RoPE功能。 - 優化訓練:使用Meta的Lingua程式碼庫的修改版本進行高效預訓練,整合z-loss及其他穩定性提升功能。
- 合成與真實資料:包含合成資料集(Depo、Brevo、Capo、Mano、Lano)產生器與真實場景評估基準(多跳、Babilong),用以測試模型的知識檢索與儲存能力。
適用對象
本專案主要針對對LLM基礎架構設計、縮放法則,以及模型如何學習階層結構並儲存知識的「物理機制」感興趣的AI研究人員與實務工作者。
亮點
- 架構創新:將Canon層引入Transformer與線性模型。
- 全面基準:提供16個基於Llama的模型與48個線性模型的訓練配方與權重。
- 交叉驗證:在真實世界預訓練環境中驗證合成預訓練的發現。
- 無縫整合:與Hugging Face及Meta的Lingua框架無縫整合。
相關
- 專案
- 專案
- 專案
- 專案
- 專案