Michael-A-Kuykendall/shimmy

⚡ Pure-Rust WebGPU inference engine — OpenAI-API compatible, GGUF native, runs on any GPU. No Python. No llama.cpp. Single binary.

해결하는 문제

Shimmy는 사용자가 로컬에서 개인적으로 GGUF 모델을 실행할 수 있도록 가벼운 단일 바이너리 추론 서버를 제공합니다. Python 런타임이나 C++ 툴체인과 같은 무거운 종속성의 필요성을 제거하고, Ollama와 같은 도구에 대한 빠른 시작 및 저메모리 대안을 제공합니다.

작동 방식

Shimmy는 OpenAI 호환 API 서버 역할을 합니다. Airframe 엔진을 사용합니다. 이는 WebGPU (WGSL) 컴퓨트 셰이더를 활용하여 다양한 GPU(NVIDIA, AMD, Intel, Apple Silicon)에서 모델을 실행하는 순수 Rust 트랜스포머 엔진입니다. GGUF 메타데이터에서 모델 사양을 자동으로 파생시키며, F32 누적 정밀도를 통해 결정론적 출력을 보장합니다.

대상 사용자

OpenAI SDK 인터페이스를 통해 기존 AI 도구와 원활하게 통합되는 최소한의 고성능 로컬 LLM 서버를 원하는 개발자 및 사용자를 위해 설계되었습니다.

주요 기능

  • OpenAI 호환성: 채팅 완성, 텍스트 완성 및 스트리밍을 지원합니다.
  • 순수 Rust: 종속성이 없는 100% Rust 구현으로 시작 시간은 1초 미만입니다.
  • WebGPU 가속: WGSL 컴퓨트 셰이더를 통한 크로스 플랫폼 GPU 지원.
  • TurboShimmy: VRAM 사용량을 크게 줄여주는 INT4 KV 캐시 압축 기능.
  • 인증된 모델: 지원되는 모델 및 양자화 조합에 대한 엄격한 3단계 인증 절차(MATH, INFERENCE, DETERMINISM).
  • 확장된 컨텍스트: 컨텍스트 창 확장을 위한 YaRN RoPE 스케일링 지원.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트