facebookresearch/PhysicsLM4

Physics of Language Models: Part 4.2, Canon Layers at Scale where Synthetic Pretraining Resonates in Reality

解決的問題

本專案提供《語言模型的物理》系列的研究程式碼與資料,特別聚焦於「Canon層」的設計,以改善大型語言模型(LLM)的架構。旨在彌補合成預訓練實驗與實際應用效能之間的差距,展示特定架構變更如何提升模型容量與知識儲存能力。

作用方式

此倉儲實作了多項關鍵架構改良,並提供重現其結果的工具:

  • Canon層:為基於Transformer的模型(如Llama)與線性模型(如GLA、GDN與Mamba2)實作「Canon-ABCD」與「Canon-AbCd」層。
  • 模型實作:提供Hugging Face相容的模型,例如LlamaCanon,支援QK-norm與部分RoPE功能。
  • 優化訓練:使用Meta的Lingua程式碼庫的修改版本進行高效預訓練,整合z-loss及其他穩定性提升功能。
  • 合成與真實資料:包含合成資料集(Depo、Brevo、Capo、Mano、Lano)產生器與真實場景評估基準(多跳、Babilong),用以測試模型的知識檢索與儲存能力。

適用對象

本專案主要針對對LLM基礎架構設計、縮放法則,以及模型如何學習階層結構並儲存知識的「物理機制」感興趣的AI研究人員與實務工作者。

亮點

  • 架構創新:將Canon層引入Transformer與線性模型。
  • 全面基準:提供16個基於Llama的模型與48個線性模型的訓練配方與權重。
  • 交叉驗證:在真實世界預訓練環境中驗證合成預訓練的發現。
  • 無縫整合:與Hugging Face及Meta的Lingua框架無縫整合。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案