qualcomm/GenieX

Run frontier LLMs and VLMs locally on Qualcomm devices across NPU, GPU, and CPU with a few lines of code

What it solves

GenieX 簡化了在 Qualcomm Snapdragon 裝置上本機執行前沿大型語言模型(LLM)與視覺語言模型(VLM)的流程。它透過提供統一介面,讓開發者不必針對特定硬體撰寫程式,即可利用 Hexagon NPU、Adreno GPU 或 CPU 進行本機推論。

How it works

GenieX 作為一個推論執行環境,封裝了兩個不同的後端:llama.cpp 用於廣泛相容 Hugging Face 的 GGUF 模型,Qualcomm AI Engine Direct(qairt)則用於 Qualcomm AI Hub 提供的最佳化、預編譯套件。它提供單一的 C SDK,並透過多種高階介面公開,包括 CLI、Python 函式庫、Android 用 Kotlin/Java、Docker,以及相容 OpenAI 的伺服器。

Who it’s for

開發 Windows ARM64(Snapdragon X/X Elite)、Android(Snapdragon 8 Elite)以及 Linux ARM64(IoT)裝置 AI 應用的開發者,想要在本機執行模型且不需撰寫低階硬體程式碼。

Highlights

  • Multi-Backend Support:在彈性使用 GGUF 模型與為取得最高 NPU 效能的預編譯套件之間切換。
  • Broad Interface Options:可透過 Python(與 Hugging Face transformers 相同介面)、CLI、Android SDK,或即插即用的相容 OpenAI API 伺服器使用。
  • Cross-Platform:支援 Windows ARM64、Android 與 Linux ARM64。
  • Hardware Acceleration:直接存取 Hexagon NPU、Adreno GPU 與 CPU。