zolotukhin/zinc
Zig INferenCe Engine — Local LLM inference on AMD GPUs and Apple Silicon
What it solves
ZINC 解决了消费级 GPU(尤其是 AMD RDNA3/RDNA4 与 Intel Arc)在本地 LLM 推理上的性能差距。这些 GPU 虽然拥有足够的带宽和 VRAM,却缺少优化的软件栈;例如 vLLM 需要 ROCm(不支持这些卡),其他引擎使用通用后端,无法利用架构特定特性。
How it works
ZINC 是一个用 Zig 编写的高性能推理引擎,使用针对不同硬件平台手工调优的 shader,而不是通用兼容层:
- AMD GPUs:使用 Vulkan compute,配合 wave64、cooperative matrix 与架构感知的 tiling。
- Intel Arc:使用 Linux Vulkan 运行时,具备 Arc 感知的设备检测与调优。
- Apple Silicon:使用原生 Metal Shading Language (MSL) 核心,配合 simdgroup reduction 与零拷贝 mmap 进行模型加载。
它作为单一二进制文件运行,不依赖 Python 或 ROCm 等庞大驱动栈,加载 GGUF 格式模型,提供兼容 OpenAI 的 API 与内置聊天 UI。
Who it’s for
该项目面向在 AMD RDNA3/RDNA4、Intel Arc 或 Apple Silicon GPU 上运行本地 LLM,且希望在无需复杂设置的情况下获得最高推理速度(decode 与 prefill)的用户。
Highlights
- 硬件特化调优:在多个模型的 decode、prefill 与端到端指标上,AMD RDNA4 上的表现优于 llama.cpp。
- 零依赖运行时:使用 Zig 编译,无需 ROCm 或 Python 安装。
- 广泛兼容性:支持 GGUF 模型,提供兼容 OpenAI 的
/v1API。 - 集成工具:包括受管模型目录(
pull、list)和内置的基于浏览器的聊天界面。