google-ai-edge/LiteRT-LM

LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.

解決的問題

LiteRT-LM 是一個專為在裝置端執行大型語言模型 (LLM) 而設計的生產級編排層。它解決了在智慧型手機、筆記型電腦和 IoT 硬體等邊緣裝置上,無需依賴雲端基礎設施即可實現 AI 模型高效能、跨平台執行的挑戰。

工作原理

它作為 LiteRT 的編排層,為執行 Gemma、Llama、Phi-4 和 Qwen 等模型提供統一的 API。它利用 GPU 和 NPU 進行硬體加速以實現效能最大化,並支援多種後端。它還包含用於快速測試的 CLI,並為 Python、Kotlin、Swift、JavaScript 和 C++ 提供特定語言的 API。

適用對象

正在為 Android、iOS、Web 和桌面平台構建裝置端 GenAI 體驗的開發者,以及針對 Raspberry Pi 等 IoT 裝置進行開發的開發者。

亮點

  • 跨平台支援:支援 Android、iOS、Web、桌面端和 IoT。
  • 硬體加速:利用 GPU 和 NPU 加速器實現巔峰效能。
  • 多模態:支援視覺和音訊輸入。
  • 工具使用:包含用於代理工作流的函式呼叫 (function calling) 支援。
  • 廣泛的模型支援:相容於 Gemma、Llama、Phi-4 和 Qwen 等模型。
  • 多 Token 預測:支援 MTP drafter 以提高推論速度。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案