warpfront/hipfire

RDNA-native LLM inference engine in Rust.

解决的问题

hipfire 是一个高性能、AMD 原生的 LLM 推理引擎,旨在充分发挥 AMD GPU(RDNA 和 CDNA 架构)的潜力。它通过提供自己的 Rust 基础运行时、HIP 内核和量化格式,消除了 Python、PyTorch 和 CUDA 翻译层带来的开销,为 AMD 硬件用户提供了类似 Ollama 的使用体验。

工作原理

该项目使用自定义的 Rust 运行时,并动态加载 ROCm 来执行模型。关键技术组件包括:

  • Redline:一个调度和保留重放基础架构,记录内核图并推导资源依赖关系,一旦图被证明是安全的,即可消除启动开销。
  • Saddle:正在开发中的基础层,旨在为 RDNA、CDNA 以及可能的 XDNA 提供一流的计算后端。
  • 自定义量化:支持多种 MQ 格式(如 MQ4、MQ4R)和 HF4,以优化吞吐量和质量。
  • 架构调优:为 RDNA3/4 实现特定于架构的内核(如 WMMA 路径),并为旧 GPU(Vega/CDNA)提供可移植的回退方案。

适用人群

拥有 AMD GPU(从消费级 RDNA1-4 到专业级 CDNA/MI300X)并希望在不使用复杂 Python 堆栈的情况下实现快速本地 LLM 和图像生成推理的用户。

主要亮点

  • AMD 原生:基于 Rust + HIP 构建,从热路径中移除 Python,实现最大效率。
  • 广泛的 GPU 支持:针对 RDNA3/4 优化,同时支持 RDNA1/2 和 Vega/CDNA 架构。
  • OpenAI 兼容 API:守护进程在端口 11435 上暴露 API,便于与现有客户端集成。
  • 精选模型注册表:包含超过 80 个精选模型条目,包括 Qwen、DeepSeek 和用于图像生成的 FLUX。
  • C 风格 CLI:使用简单命令进行模型拉取、服务启动和聊天(例如 hipfire pullhipfire chat)。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目