luminal-ai/luminal

Inference at the speed of light.

解決的問題

Luminal 是一個高效率的推論編譯器,旨在消除傳統深度學習框架中常見的複雜性與效能開銷。它透過將所有神經網路視為可提前編譯的靜態計算圖,解決了傳統編譯器堆疊(如 XLA 或 TVM)的「複雜性爆炸」問題,以及像 PyTorch 這種急切執行(eager-first)方式的低效率,從而實現最大程度的硬體效率。

工作原理

Luminal 採用 RISC 風格架構,將所有運算簡化為 15 種基本運算。它不依賴手寫的啟發式規則或破壞性重寫規則,而是採用基於搜尋的方法,自動發現最高效的執行路徑與最佳化(例如 Flash Attention)。它使用 Rust 寫成,並直接與加速器 API(CUDA、Metal)互動,避免抽象層。同時支援符號維度,以處理動態形狀,同時保持激進的專門化能力。

適用對象

適用於需要在任何裝置上實現最大推論效能的開發者與研究人員,特別是尋找輕量級、靜態連結的 Rust 替代方案以取代重型 ML 框架,或希望使用 PyTorch 模型並搭配高效率編譯器後端的人。

特色亮點

  • PyTorch 整合:作為 torch.compile 後端運行,允許使用者直接編譯 PyTorch 模型。
  • 極致效能:可在 H100 上以約理論最大效能的 80% 執行 Q8 Llama 3 8B 模型。
  • 基於搜尋的最佳化:無需手動啟發式規則,即可自動發現複雜最佳化。
  • 極簡核心:設計極為簡潔,整個核心函式庫可在半天內完全理解。
  • 原生 Rust:靜態連結的 crate,無需 Docker 容器或虛擬環境。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案