peonist-ai/halogen-flash-server
The fastest way to run Qwen3.8-Flash-Next on Strix Halo (gfx1151)
解決的問題
Halogen Flash Server 是專為在 AMD Strix Halo 硬體上執行的 Qwen3.8-Flash-Next 模型系列所設計的高性能推論引擎。透過消除通用執行時開銷與可攜性層,大幅提升了預填入(prefill)與解碼(decode)速度,特別是在處理長上下文提示時,遠超一般引擎表現。
工作原理
本專案實作專為單一 GPU 與單一模型系列量身打造的自訂內核,移除所有備用路徑與可攜性層。利用推測解碼(結合模型自身的草稿頭與提示查詢),在不犧牲輸出品質的前提下優化速度。伺服器提供 OpenAI 相容 API(/v1),同時支援 OpenAI Responses API,以確保與 OpenAI Codex CLI 等工具的相容性。
適用對象
希望在本地以最快速度執行 Qwen3.8-Flash-Next 的 AMD Strix Halo 硬體使用者,特別是需要高精度(5.53 bpw)與長上下文能力(最高支援 1M 個 token)的使用者。
主要亮點
- 硬體特化優化:針對 AMD Strix Halo 定製的內核,達成極致效能。
- 高速性能:聲稱在相同硬體上比競爭性執行時快約 4 倍的端對端效能。
- 推測解碼:純速度優化,溫度為 0 時輸出與串行貪婪解碼完全一致(位元級相同)。
- OpenAI 相容性:支援標準聊天補全與 Responses API。
- 視覺支援:可選視覺塔整合,支援影像處理,解析度與縮放可設定。
- 記憶體管理:明確管理鎖定權重與 KV 池位置,優化 128 GB 機器上的統一記憶體使用。
相關
- 專案
- 專案
- 專案
- 專案