zolotukhin/zinc

Zig INferenCe Engine — Local LLM inference on AMD GPUs and Apple Silicon

What it solves

ZINC는 소비자용 GPU(특히 AMD RDNA3/RDNA4와 Intel Arc)에서 로컬 LLM 추론 성능 격차를 해소합니다. 이러한 GPU는 충분한 대역폭과 VRAM을 가지고 있지만 최적화된 소프트웨어 스택이 부족합니다. vLLM 같은 도구는 ROCm을 필요로 하는데(해당 카드 미지원), 다른 엔진들은 일반 백엔드를 사용해 아키텍처 특화 기능을 활용하지 못합니다.

How it works

ZINC는 Zig로 작성된 고성능 추론 엔진으로, 일반적인 호환 레이어 대신 하드웨어별로 손수 튜닝한 셰이더를 사용합니다:

  • AMD GPUs: Vulkan 컴퓨트를 사용하고 wave64, cooperative matrix, 아키텍처 인식 타일링을 적용합니다.
  • Intel Arc: Linux Vulkan 런타임을 사용하며 Arc 인식 디바이스 탐지와 튜닝을 수행합니다.
  • Apple Silicon: 네이티브 Metal Shading Language(MSL) 커널을 사용하고 simdgroup reduction 및 제로 카피 mmap을 통해 모델을 로드합니다.

단일 바이너리로 동작하며 Python이나 ROCm 같은 무거운 드라이버 스택에 의존하지 않고, GGUF 포맷 모델을 로드하고 OpenAI 호환 API와 내장 채팅 UI를 제공합니다.

Who it’s for

AMD RDNA3/RDNA4, Intel Arc, Apple Silicon GPU에서 로컬 LLM을 실행하고 복잡한 설정 없이 최대 추론 속도(디코드 및 프리필)를 원하는 사용자들을 위한 프로젝트입니다.

Highlights

  • 하드웨어 특화 튜닝: AMD RDNA4에서 여러 모델의 디코드, 프리필, 엔드투엔드 지표가 llama.cpp보다 우수합니다.
  • 제로 의존 런타임: Zig로 빌드되어 ROCm이나 Python 설치가 필요 없습니다.
  • 광범위한 호환성: GGUF 모델을 지원하고 OpenAI 호환 /v1 API를 제공합니다.
  • 통합 툴링: 관리형 모델 카탈로그(pull, list)와 내장 브라우저 기반 채팅 인터페이스를 포함합니다.