zolotukhin/zinc

Zig INferenCe Engine — Local LLM inference on AMD GPUs and Apple Silicon

What it solves

ZINC 解決了消費級 GPU(特別是 AMD RDNA3/RDNA4 與 Intel Arc)在本地 LLM 推論上的效能落差。這些 GPU 雖然具備足夠的頻寬與 VRAM,卻缺乏最佳化的軟體堆疊;例如 vLLM 需要 ROCm(不支援這些卡),其他引擎則使用通用後端,無法利用特定架構的特性。

How it works

ZINC 是以 Zig 撰寫的高效能推論引擎,使用針對不同硬體平台手工調校的 shader,而非通用相容層:

  • AMD GPUs:使用 Vulkan compute,搭配 wave64、cooperative matrix 與架構感知的 tiling。
  • Intel Arc:使用 Linux Vulkan 執行環境,具備 Arc 感知的裝置偵測與調校。
  • Apple Silicon:使用原生 Metal Shading Language (MSL) 核心,搭配 simdgroup reduction 與零拷貝 mmap 進行模型載入。

它以單一二進位檔運作,無需 Python 或 ROCm 等龐大驅動堆疊,支援 GGUF 格式模型,提供相容 OpenAI 的 API 與內建聊天 UI。

Who it’s for

此專案適合在 AMD RDNA3/RDNA4、Intel Arc 或 Apple Silicon GPU 上執行本地 LLM,且希望在不需繁雜設定的情況下獲得最高的推論速度(decode 與 prefill)。

Highlights

  • 硬體特化調校:在多個模型的 decode、prefill 與端到端指標上,AMD RDNA4 上的表現優於 llama.cpp。
  • 零相依執行環境:使用 Zig 編譯,無需 ROCm 或 Python 安裝。
  • 廣泛相容性:支援 GGUF 模型,提供相容 OpenAI 的 /v1 API。
  • 整合工具:內建模型目錄管理(pulllist)與瀏覽器式聊天介面。