facebookresearch/PhysicsLM4
Physics of Language Models: Part 4.2, Canon Layers at Scale where Synthetic Pretraining Resonates in Reality
解决的问题
本项目提供《语言模型的物理》系列的研究代码和数据,重点聚焦于“Canon层”的设计,以改进大语言模型(LLM)的架构。旨在弥合合成预训练实验与真实世界性能之间的差距,展示特定架构变化如何提升模型容量和知识存储能力。
工作原理
该仓库实现了多项关键架构改进,并提供了复现其结果的工具:
- Canon层:为基于Transformer的模型(如Llama)和线性模型(如GLA、GDN和Mamba2)实现「Canon-ABCD」和「Canon-AbCd」层。
- 模型实现:提供Hugging Face兼容的模型,如
LlamaCanon,支持QK-norm和部分RoPE功能。 - 优化训练:使用Meta的Lingua代码库的修改版本进行高效预训练,集成z-loss及其他稳定性改进。
- 合成与真实数据:包含合成数据集(Depo、Brevo、Capo、Mano、Lano)生成器和真实场景评估基准(多跳、Babilong),用于测试模型的知识检索与存储能力。
适用人群
本项目主要面向对LLM基础架构设计、缩放定律,以及模型如何学习层次结构并存储知识的“物理机制”感兴趣的AI研究人员和实践者。
亮点
- 架构创新:将Canon层引入Transformer和线性模型。
- 全面基准:提供16个基于Llama的模型和48个线性模型的训练配方与权重。
- 交叉验证:在真实世界预训练环境中验证合成预训练的发现。
- 无缝集成:与Hugging Face和Meta的Lingua框架无缝集成。
相关
- 项目
- 项目
- 项目
- 项目
- 项目