zolotukhin/zinc
Zig INferenCe Engine — Local LLM inference on AMD GPUs and Apple Silicon
What it solves
ZINC 解決了消費級 GPU(特別是 AMD RDNA3/RDNA4 與 Intel Arc)在本地 LLM 推論上的效能落差。這些 GPU 雖然具備足夠的頻寬與 VRAM,卻缺乏最佳化的軟體堆疊;例如 vLLM 需要 ROCm(不支援這些卡),其他引擎則使用通用後端,無法利用特定架構的特性。
How it works
ZINC 是以 Zig 撰寫的高效能推論引擎,使用針對不同硬體平台手工調校的 shader,而非通用相容層:
- AMD GPUs:使用 Vulkan compute,搭配 wave64、cooperative matrix 與架構感知的 tiling。
- Intel Arc:使用 Linux Vulkan 執行環境,具備 Arc 感知的裝置偵測與調校。
- Apple Silicon:使用原生 Metal Shading Language (MSL) 核心,搭配 simdgroup reduction 與零拷貝 mmap 進行模型載入。
它以單一二進位檔運作,無需 Python 或 ROCm 等龐大驅動堆疊,支援 GGUF 格式模型,提供相容 OpenAI 的 API 與內建聊天 UI。
Who it’s for
此專案適合在 AMD RDNA3/RDNA4、Intel Arc 或 Apple Silicon GPU 上執行本地 LLM,且希望在不需繁雜設定的情況下獲得最高的推論速度(decode 與 prefill)。
Highlights
- 硬體特化調校:在多個模型的 decode、prefill 與端到端指標上,AMD RDNA4 上的表現優於 llama.cpp。
- 零相依執行環境:使用 Zig 編譯,無需 ROCm 或 Python 安裝。
- 廣泛相容性:支援 GGUF 模型,提供相容 OpenAI 的
/v1API。 - 整合工具:內建模型目錄管理(
pull、list)與瀏覽器式聊天介面。