zml/zml

Any model. Any hardware. Zero compromise. Built with @ziglang / @openxla / MLIR / @bazelbuild

What it solves

ZML은 AI 워크로드를 독점 하드웨어와 분리하도록 설계된 프로덕션 추론 스택입니다. 개발자는 각 플랫폼마다 코드를 다시 작성할 필요 없이 다양한 하드웨어 가속기에서 모델을 실행할 수 있습니다.

How it works

Zig 언어, MLIR, Bazel을 사용해 구축된 ZML은 모델을 직접 여러 하드웨어 백엔드로 컴파일합니다. NVIDIA CUDA, AMD ROCm, Intel OneAPI, Google TPU, AWS Trainium/Inferentia 2 등 다양한 가속기를 지원하여 선택한 하드웨어에서 최고의 성능을 보장합니다.

Who it’s for

하드웨어 락인을 피하고 다중 플랫폼 배포를 위해 단일 코드베이스를 유지하고자 하는 프로덕션 AI 추론 시스템을 구축하는 개발자와 엔지니어를 위한 것입니다.

Highlights

  • Multi-Hardware Support: Native compilation for NVIDIA, AMD, Intel, and TPU/Trainium accelerators.
  • Unified Codebase: Run any model on many hardwares using one codebase.
  • LLM Support: Out-of-the-box support for Llama 3.1/3.2, Qwen 3.5, and LFM 2.5.
  • Flexible Loading: Ability to load models from Hugging Face, S3, or local directories via a VFS layer.
  • High Performance: Compiled directly to hardware for peak execution speed.