mirage-project/mirage
Mirage Persistent Kernel: Compiling LLMs into a MegaKernel
解决的问题
Mirage Persistent Kernel (MPK) 解决了多 GPU LLM 推理带来的高延迟问题。它通过将整个推理过程融合为一个单一的「巨核」,消除了启动多个 GPU 内核的开销以及它们之间的通信瓶颈。
工作原理
MPK 作为一个编译器和运行时系统,将 LLM 的计算图转换为一个单一的融合 GPU 内核。它不为每个操作单独启动内核,而是在一次启动中完成所有必要的计算和通信。开发者通过串联融合操作(如 rmsnorm_linear_layer)来定义内核的输入、输出和计算图,然后将该图编译为优化的可执行内核。
适用人群
专注于低延迟 LLM 推理和 GPU 优化的 ML 工程师和研究人员,希望在无需大量手动 CUDA 编程的情况下降低推理延迟。
主要亮点
- 显著降低延迟:将 LLM 推理延迟降低 1.2 倍至 6.7 倍。
- 端到端融合:将计算与通信融合为单次 GPU 内核启动。
- 自动编译:通过高级 Python API 将 Hugging Face 模型编译为巨核。
- 集成性能分析:包含工具,用于可视化巨核内每个任务的执行时间线。
相关
- 项目
- 项目
- 项目
- 项目
- 项目