peonist-ai/halogen-flash-server

The fastest way to run Qwen3.8-Flash-Next on Strix Halo (gfx1151)

解决的问题

Halogen Flash Server 是专为在 AMD Strix Halo 硬件上运行的 Qwen3.8-Flash-Next 模型系列设计的高性能推理引擎。它通过消除通用运行时开销和可移植性层,显著提升了预填充(prefill)和解码(decode)速度,尤其在处理长上下文提示时表现远超通用引擎。

工作原理

该项目实现了专为单一 GPU 和单一模型系列定制的内核,移除了所有回退路径和可移植性层。通过使用推测解码(结合模型自身的草稿头和提示查找),在不牺牲输出质量的前提下优化速度。该服务器提供 OpenAI 兼容 API(/v1),同时也支持 OpenAI Responses API,以确保与 OpenAI Codex CLI 等工具的兼容性。

适用人群

希望在本地以最快速度运行 Qwen3.8-Flash-Next 的 AMD Strix Halo 硬件用户,特别是需要高精度(5.53 bpw)和长上下文能力(最高支持 1M 个 token)的用户。

主要亮点

  • 硬件特化优化:为 AMD Strix Halo 定制的内核,实现极致性能。
  • 高速性能:声称在相同硬件上比竞品运行时快约 4 倍的端到端性能。
  • 推测解码:纯速度优化,温度为 0 时输出与串行贪婪解码完全一致(字节级相同)。
  • OpenAI 兼容性:支持标准聊天补全和 Responses API。
  • 视觉支持:可选视觉塔集成,支持图像处理,分辨率和缩放可配置。
  • 内存管理:显式管理锁定权重和 KV 池位置,优化 128 GB 机器上的统一内存使用。

相关

  • 项目
  • 项目
  • 项目
  • 项目