Kaden-Schutt/hipfire

RDNA-native LLM inference engine in Rust.

What it solves

hipfire は AMD RDNA GPU(コンシューマ、プロ、APU)向けに最適化された高性能 LLM 推論を提供します。標準的なツール(例: ROCm と組み合わせた llama.cpp)は扱いにくく、コンシューマ向けカードをデータセンター向けハードウェアに比べて二次的に扱うことが多いという課題を解決します。

How it works

Rust と HIP で構築され、単一バイナリとして配布されるため、ランタイムのホットパスから Python と PyTorch を排除しています。事前コンパイルされたカーネルブロブと HIP の JIT コンパイルを利用し、RDNA ファミリー全体(RDNA1〜RDNA4)を対象にします。エンジンはカーネル(GEMM、attention、MoE など)用の統一ディスパッチシステムを備え、投機的デコード(DFlash)やマルチ GPU 環境でのエキスパートパラレルサービングといった高度な手法をサポートします。

Who it’s for

AMD RDNA GPU を所有し、ローカルで LLM を実行する際に、ハードウェア利用率を最大化しつつソフトウェアのオーバーヘッドを最小にした「Ollama スタイル」の体験を求めるユーザー向けです。

Highlights

  • Broad Hardware Support: RDNA1、RDNA2、RDNA3、RDNA4 を対象に、コンシューマ、プロ、APU バリエーションを網羅。
  • High Performance: RDNA3 ハードウェア(例: 7900 XTX)上で Ollama に比べて大幅なデコード速度向上を実現。
  • Speculative Decoding: DFlash を実装し、特定モデルのトークン生成速度を劇的に向上。
  • Multi-GPU Support: エキスパートパラレルサービングにより、Large MoE モデル(例: DeepSeek V4 Flash)を複数 GPU に跨げてシャーディング可能。
  • Memory Management: CASK ベースの KV キャッシュエビクションを搭載し、長コンテキストプロンプト時のメモリ不足(OOM)エラーを防止。
  • Developer Friendly: OpenAI 互換 API とシンプルな CLI を提供し、モデルの取得、実行、サービングを容易にします。