zolotukhin/zinc

Zig INferenCe Engine — Local LLM inference on AMD GPUs and Apple Silicon

What it solves

ZINC 解决了消费级 GPU(尤其是 AMD RDNA3/RDNA4 与 Intel Arc)在本地 LLM 推理上的性能差距。这些 GPU 虽然拥有足够的带宽和 VRAM,却缺少优化的软件栈;例如 vLLM 需要 ROCm(不支持这些卡),其他引擎使用通用后端,无法利用架构特定特性。

How it works

ZINC 是一个用 Zig 编写的高性能推理引擎,使用针对不同硬件平台手工调优的 shader,而不是通用兼容层:

  • AMD GPUs:使用 Vulkan compute,配合 wave64、cooperative matrix 与架构感知的 tiling。
  • Intel Arc:使用 Linux Vulkan 运行时,具备 Arc 感知的设备检测与调优。
  • Apple Silicon:使用原生 Metal Shading Language (MSL) 核心,配合 simdgroup reduction 与零拷贝 mmap 进行模型加载。

它作为单一二进制文件运行,不依赖 Python 或 ROCm 等庞大驱动栈,加载 GGUF 格式模型,提供兼容 OpenAI 的 API 与内置聊天 UI。

Who it’s for

该项目面向在 AMD RDNA3/RDNA4、Intel Arc 或 Apple Silicon GPU 上运行本地 LLM,且希望在无需复杂设置的情况下获得最高推理速度(decode 与 prefill)的用户。

Highlights

  • 硬件特化调优:在多个模型的 decode、prefill 与端到端指标上,AMD RDNA4 上的表现优于 llama.cpp。
  • 零依赖运行时:使用 Zig 编译,无需 ROCm 或 Python 安装。
  • 广泛兼容性:支持 GGUF 模型,提供兼容 OpenAI 的 /v1 API。
  • 集成工具:包括受管模型目录(pulllist)和内置的基于浏览器的聊天界面。