peonist-ai/halogen-flash-server
The fastest way to run Qwen3.8-Flash-Next on Strix Halo (gfx1151)
何を解決するか
Halogen Flash Server は、AMD Strix Halo ハードウェア上で実行される Qwen3.8-Flash-Next モデルファミリー専用に設計された高性能推論エンジンです。汎用ランタイムのオーバーヘッドやポータビリティレイヤーを排除することで、特に長文プロンプトに対して、汎用エンジンよりも大幅に高速なプレフィルおよびデコード速度を実現します。
動作方法
このプロジェクトは、特定の GPU と特定のモデルファミリーに特化したカスタムカーネルを実装しており、すべてのフォールバックパスやポータビリティレイヤーを削除しています。モデル独自のドラフトヘッドとプロンプト検索を用いた予測的デコードを活用し、出力品質を損なうことなく速度を最適化しています。サーバーは OpenAI 互換 API(/v1)を提供し、OpenAI Responses API もサポートしており、OpenAI Codex CLI などのツールとの互換性を確保しています。
対象ユーザー
Qwen3.8-Flash-Next を最も高速にローカルで実行したい AMD Strix Halo ハードウェアをお持ちのユーザー、特に高精度(5.53 bpw)および長文コンテキスト(最大 1M トークン)を必要とするユーザー向けです。
主な特徴
- ハードウェア特化最適化: AMD Strix Halo 向けに最適化されたカスタムカーネルで、最大のパフォーマンスを実現。
- 高速性: 同じハードウェア上で競合するランタイムと比較して、約 4 倍のエンドツーエンド性能を達成すると主張。
- 予測的デコード: シリアルなグリーディデコード(温度 0)とバイト単位で同一の出力を維持する純粋な速度最適化。
- OpenAI 互換性: 標準的なチャットコンプリーションと Responses API をサポート。
- ビジョン対応: 画像処理用のオプションのビジョンタワーを統合可能で、解像度とスケーリングを設定可能。
- メモリ管理: 128 GB マシンにおけるユニファイドメモリ使用を最適化するため、ロックされた重みと KV プール位置を明示的に管理。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト