qualcomm/GenieX
Run frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code
What it solves
GenieX는 Qualcomm Snapdragon 디바이스에서 최첨단 대규모 언어 모델(LLM) 및 비전 언어 모델(VLM)을 로컬에서 실행하는 과정을 단순화합니다. Hexagon NPU, Adreno GPU 또는 CPU를 활용할 수 있는 통합 인터페이스를 제공함으로써 특정 하드웨어를 타깃팅하는 복잡성을 제거합니다.
How it works
GenieX는 추론 런타임으로서 두 가지 다른 백엔드를 래핑합니다: Hugging Face의 GGUF 모델과 폭넓게 호환되는 llama.cpp, 그리고 Qualcomm AI Hub에서 제공되는 최적화된 사전 컴파일 번들을 활용하는 Qualcomm AI Engine Direct(qairt). 단일 C SDK를 제공하며, CLI, Python 라이브러리, Android용 Kotlin/Java, Docker, OpenAI 호환 서버 등 여러 고수준 인터페이스를 통해 사용할 수 있습니다.
Who it’s for
Windows ARM64(Snapdragon X/X Elite), Android(Snapdragon 8 Elite), Linux ARM64(IoT) 디바이스용 AI 애플리케이션을 개발하고, 저수준 하드웨어 코드를 작성하지 않고도 로컬에서 모델을 실행하고자 하는 개발자를 위한 것입니다.
Highlights
- Multi-Backend Support: 유연성을 위한 GGUF 모델과 NPU 최고 성능을 위한 사전 컴파일 번들을 전환할 수 있습니다.
- Broad Interface Options: Python(Hugging Face transformers와 동일), CLI, Android SDK, 혹은 즉시 사용할 수 있는 OpenAI 호환 API 서버를 통해 접근 가능합니다.
- Cross-Platform: Windows ARM64, Android, Linux ARM64를 지원합니다.
- Hardware Acceleration: Hexagon NPU, Adreno GPU, CPU에 직접 접근합니다.