qualcomm/GenieX
Run frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code
What it solves
GenieX 简化了在 Qualcomm Snapdragon 设备上本地运行前沿大型语言模型(LLM)和视觉语言模型(VLM)的过程。它通过提供统一接口,让开发者无需针对特定硬件编写代码,即可利用 Hexagon NPU、Adreno GPU 或 CPU 进行本地推理。
How it works
GenieX 充当一个推理运行时,封装了两个不同的后端:llama.cpp 用于广泛兼容 Hugging Face 的 GGUF 模型,Qualcomm AI Engine Direct(qairt)用于 Qualcomm AI Hub 提供的优化、预编译套件。它提供单一的 C SDK,并通过多种高级接口公开,包括 CLI、Python 库、Android 的 Kotlin/Java、Docker,以及兼容 OpenAI 的服务器。
Who it’s for
为 Windows ARM64(Snapdragon X/X Elite)、Android(Snapdragon 8 Elite)以及 Linux ARM64(IoT)设备构建 AI 应用的开发者,想要在本地运行模型且不编写底层硬件代码。
Highlights
- Multi-Backend Support:在灵活使用 GGUF 模型和获取最高 NPU 性能的预编译套件之间切换。
- Broad Interface Options:可通过 Python(与 Hugging Face transformers 相同接口)、CLI、Android SDK,或即插即用的兼容 OpenAI API 服务器使用。
- Cross-Platform:支持 Windows ARM64、Android 与 Linux ARM64。
- Hardware Acceleration:直接访问 Hexagon NPU、Adreno GPU 与 CPU。