peonist-ai/halogen-flash-server

The fastest way to run Qwen3.8-Flash-Next on Strix Halo (gfx1151)

해결하는 문제

Halogen Flash Server는 AMD Strix Halo 하드웨어에서 실행되는 Qwen3.8-Flash-Next 모델 패밀리를 위한 고성능 추론 엔진입니다. 일반적인 런타임 오버헤드와 포터블 레이어를 제거함으로써, 특히 긴 컨텍스트 프롬프트에 대해 일반적인 엔진보다 훨씬 빠른 프리필 및 디코딩 속도를 제공합니다.

작동 방식

이 프로젝트는 특정 GPU와 특정 모델 패밀리에 특화된 커스텀 커널을 구현하여 모든 백업 경로와 포터블 레이어를 제거합니다. 모델 자체의 드래프트 헤드와 프롬프트 검색을 활용한 사전 추론(스펙ulative 디코딩)을 사용하여 출력 품질을 희생하지 않고 속도를 최적화합니다. 서버는 OpenAI 호환 API(/v1)를 제공하며, OpenAI Responses API도 지원하여 OpenAI Codex CLI와 같은 도구와의 호환성을 보장합니다.

대상 사용자

Qwen3.8-Flash-Next를 가장 빠르게 로컬에서 실행하고 싶은 AMD Strix Halo 하드웨어 사용자, 특히 고정밀도(5.53 bpw)와 긴 컨텍스트 기능(최대 1M 토큰)이 필요한 사용자에게 적합합니다.

주요 특징

  • 하드웨어 특화 최적화: AMD Strix Halo에 맞춰 최적화된 커스텀 커널로 최대 성능을 발휘.
  • 고속 성능: 동일한 하드웨어에서 경쟁 런타임보다 약 4배 빠른 엔드투엔드 성능을 주장.
  • 사전 추론: 온도 0에서 시리얼 그리디 디코딩과 바이트 수준에서 동일한 출력을 유지하는 순수한 속도 최적화.
  • OpenAI 호환성: 표준 챗 컴플리션과 Responses API를 지원.
  • 비전 지원: 이미지 처리를 위한 선택적 비전 타워 통합 가능하며, 해상도와 스케일링을 구성 가능.
  • 메모리 관리: 128GB 시스템에서 유니파이드 메모리 사용을 최적화하기 위해 잠긴 가중치와 KV 풀 위치를 명시적으로 관리.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트