luminal-ai/luminal

Inference at the speed of light.

解决的问题

Luminal 是一个高性能的推理编译器,旨在消除传统深度学习框架中存在的复杂性和性能开销。它通过将所有神经网络视为可提前编译的静态计算图,解决了传统编译栈(如 XLA 或 TVM)的“复杂性爆炸”问题,以及像 PyTorch 这样的急切执行(eager-first)方式的低效性,从而实现最大程度的硬件效率。

工作原理

Luminal 采用 RISC 风格架构,将所有操作简化为 15 种基本操作。它不依赖手工编写的启发式规则或破坏性重写规则,而是采用基于搜索的方法,自动发现最高效的执行路径和优化(如 Flash Attention)。它使用 Rust 编写,并直接与加速器 API(CUDA、Metal)交互,避免抽象层。同时支持符号维度,以处理动态形状,同时保持激进的专门化能力。

适用人群

适用于需要在任何设备上实现最大推理性能的开发者和研究人员,特别是那些寻找轻量级、静态链接的 Rust 替代方案以替代重型 ML 框架,或希望使用 PyTorch 模型并搭配高性能编译器后端的人。

特色亮点

  • PyTorch 集成:作为 torch.compile 后端运行,允许用户直接编译 PyTorch 模型。
  • 极致性能:可在 H100 上以约理论最大性能的 80% 运行 Q8 Llama 3 8B 模型。
  • 基于搜索的优化:无需手动启发式规则,即可自动发现复杂优化。
  • 极简核心:设计极为简洁,整个核心库可在半天内完全理解。
  • 原生 Rust:静态链接的 crate,无需 Docker 容器或虚拟环境。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目