Kaden-Schutt/hipfire

RDNA-native LLM inference engine in Rust.

What it solves

hipfire 提供专为 AMD RDNA GPU(消费级、专业级和 APU)优化的高性能 LLM 推理。它解决了在消费级 AMD 硬件上运行模型的难题,传统工具如配合 ROCm 的 llama.cpp 往往笨重,并且常把消费卡视为次等于数据中心硬件。

How it works

使用 Rust 与 HIP 构建,项目以单个二进制文件发布,消除了运行时热路径中的 Python 与 PyTorch。它使用预编译的 kernel blob 并通过 HIP 的 JIT 编译,覆盖整个 RDNA 系列(RDNA1 到 RDNA4)。引擎具备统一的 kernel 调度系统(GEMM、attention、MoE 等),并支持投机解码(DFlash)和多 GPU 环境的 expert‑parallel 服务等高级技术。

Who it’s for

拥有 AMD RDNA GPU、希望以最小的软件开销、最大化硬件利用率在本地运行 LLM,并获得类似 Ollama 体验的用户。

Highlights

  • Broad Hardware Support: 支持 RDNA1、RDNA2、RDNA3 与 RDNA4,覆盖消费、专业和 APU 变体。
  • High Performance: 在 RDNA3 硬件(如 7900 XTX)上相较于 Ollama 有显著的解码加速。
  • Speculative Decoding: 实现 DFlash,能够大幅提升特定模型的 token 生成速度。
  • Multi-GPU Support: Expert‑parallel 服务允许将大型 MoE 模型(如 DeepSeek V4 Flash)在多张 GPU 上分片。
  • Memory Management: 包含基于 CASK 的 KV 缓存驱逐,防止长上下文提示期间出现内存不足(OOM)错误。
  • Developer Friendly: 提供兼容 OpenAI 的 API 与简易 CLI,用于拉取、运行和服务模型。