NX-AI/xlstm
Official repository of the xLSTM.
What it solves
xLSTM(Extended Long Short-Term Memory)旨在克服原始 LSTM 架构的限制,与 Transformer 与 State Space Models(SSM)在语言建模上竞争。它提供一种对于大型语言模型在训练与推理上皆高效的循环神经网络(RNN)替代方案。
How it works
此架构在原始 LSTM 基础上引入两项主要增强:
- Exponential Gating:使用归一化与稳定化技术,提升网络信息流的管理能力。
- Matrix Memory:全新记忆结构,使网络能更好地处理复杂数据模式。
项目提供两个主要组件:xLSTMBlockStack(一般应用的骨干)与 xLSTMLMModel(用于基于 token 的语言建模的包装器)。同时也包含针对训练吞吐量与稳定性优化的 xLSTMLarge 架构,该架构已用于在 2.3 万亿 token 上训练出 7B 参数模型。
Who it’s for
- AI Researchers:寻找 Transformer 之外的序列建模替代方案的研究者。
- ML Engineers:实现循环模型以达成快速且高效推理的开发者。
- Developers:希望将 xLSTM 骨干整合至现有项目,作为 Transformer 模块的替代方案的用户。
Highlights
- 7B Parameter Model:在 2.3T token 上训练的大规模循环 LLM。
- Optimized Kernels:通过
mlstm_kernels包支持 Triton 与 CUDA 核心,提供在 NVIDIA 与 AMD GPU 上的高性能执行。 - Flexible Architecture:支持 sLSTM 与 mLSTM 模块,可组合以平衡状态追踪与记忆能力。
- Hardware Compatibility:提供原生 PyTorch 实现,支持 Apple Metal(并有社区移植至 MLX)等平台。