NX-AI/xlstm

Official repository of the xLSTM.

What it solves

xLSTM(Extended Long Short-Term Memory)旨在克服原始 LSTM 架構的限制,與 Transformer 與 State Space Models(SSM)在語言建模上競爭。它提供一種對於大型語言模型在訓練與推論上皆高效的循環神經網路(RNN)替代方案。

How it works

此架構在原始 LSTM 基礎上引入兩項主要增強:

  1. Exponential Gating:使用正規化與穩定化技術,提升網路資訊流的管理能力。
  2. Matrix Memory:全新記憶結構,使網路能更好地處理複雜資料模式。

專案提供兩個主要元件:xLSTMBlockStack(一般應用的骨幹)與 xLSTMLMModel(用於基於 token 的語言建模的包裝器)。同時也包含針對訓練吞吐量與穩定性優化的 xLSTMLarge 架構,該架構已用於在 2.3 兆 token 上訓練出 7B 參數模型。

Who it’s for

  • AI Researchers:尋找 Transformer 之外的序列建模替代方案的研究者。
  • ML Engineers:實作循環模型以達成快速且高效推論的開發者。
  • Developers:希望將 xLSTM 骨幹整合至現有專案,作為 Transformer 模組的替代方案的使用者。

Highlights

  • 7B Parameter Model:在 2.3T token 上訓練的大規模循環 LLM。
  • Optimized Kernels:透過 mlstm_kernels 套件支援 Triton 與 CUDA 核心,提供在 NVIDIA 與 AMD GPU 上的高效能執行。
  • Flexible Architecture:支援 sLSTM 與 mLSTM 模組,可組合以平衡狀態追蹤與記憶能力。
  • Hardware Compatibility:提供原生 PyTorch 實作,支援 Apple Metal(並有社群移植至 MLX)等平台。