warpfront/hipfire

RDNA-native LLM inference engine in Rust.

解决的问题

hipfire 是专门针对 AMD RDNA GPU(从 RDNA1 到 RDNA4)优化的高性能 LLM 推理引擎,包括消费级显卡、专业级显卡和 APU。它解决了在消费级 AMD 硬件上运行 LLM 的难题,因为官方的 ROCm 支持通常仅限于数据中心显卡,导致现有的工具(如 llama.cpp + ROCm)使用起来往往非常痛苦。

工作原理

hipfire 基于 Rust 和 HIP 构建,提供单个二进制文件,在执行路径中避免了 Python 和 PyTorch。它使用预编译的内核 blob 和通过 HIP 进行的 JIT 编译来针对各种 RDNA 架构。该引擎支持针对 DeepSeek V4 Flash 等大型 MoE 模型的多 GPU 专家并行推理,并实现了投机解码 (DFlash) 以提高 Token 生成速度。

适用对象

拥有 AMD RDNA GPU 且希望以最大硬件利用率和性能运行本地 LLM,并寻求流线化“Ollama 风格”体验的用户。

亮点

  • 广泛的 AMD 支持: 针对整个 RDNA 系列(RDNA1 到 RDNA4)。
  • 兼容 OpenAI 的 API: 包括一个用于通过 HTTP API 提供模型服务的后台守护进程。
  • 投机解码: 实现 DFlash 以显著提升特定提示词的解码速度。
  • 多 GPU 支持: 支持针对大型模型的跨多 GPU 专家并行分片。
  • 量化工具: 包括用于转换 HF、safetensors 和 GGUF 模型的 hipfire quantize
  • 内存管理: 使用基于 CASK 的 KV 缓存驱逐机制,在不耗尽内存的情况下处理长上下文提示词。