warpfront/hipfire

RDNA-native LLM inference engine in Rust.

解決する課題

hipfireは、コンシューマー向けカード、プロ向けカード、APUを含む、AMD RDNA GPU(RDNA1からRDNA4)に特化して最適化された高性能LLM推論エンジンです。公式のROCmサポートはデータセンター向けカードに限定されることが多く、既存のllama.cpp + ROCmなどのツールは使用が困難な場合があるという、コンシューマー向けAMDハードウェアでLLMを実行する際の難しさを解決します。

仕組み

RustとHIPで構築されたhipfireは、実行パスからPythonとPyTorchを排除した単一のバイナリを提供します。プリコンパイルされたカーネルブロブとHIPによるJITコンパイルを使用して、さまざまなRDNAアーキテクチャをターゲットにします。このエンジンは、DeepSeek V4 Flashのような大規模なMoEモデルのためのマルチGPUエキスパート並列サービングをサポートし、トークン生成速度を向上させるために投機的デコーディング(DFlash)を実装しています。

対象ユーザー

ハードウェアの利用率とパフォーマンスを最大限に高めつつ、ローカルLLMを実行するための合理化された「Ollamaスタイル」の体験を求める、AMD RDNA GPUのユーザー。

ハイライト

  • 幅広いAMDサポート: RDNAファミリー全体(RDNA1からRDNA4)をターゲット。
  • OpenAI互換API: HTTP APIを介してモデルをサービングするためのバックグラウンドデーモンを含む。
  • 投機的デコーディング: 特定のプロンプトに対してデコード速度を大幅に向上させるDFlashを実装。
  • マルチGPUサポート: 大規模モデル向けに、複数のGPUにわたるエキスパート並列シャーディングをサポート。
  • 量子化ツール: HF、safetensors、GGUFモデルを変換するための hipfire quantize を含む。
  • メモリ管理: CASKベースのKVキャッシュエビクションを使用して、メモリ不足を起こさずにロングコンテキストのプロンプトを処理。