google-ai-edge/LiteRT-LM
LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.
解決的問題
LiteRT-LM 是一個專為在裝置端執行大型語言模型 (LLM) 而設計的生產級編排層。它解決了在智慧型手機、筆記型電腦和 IoT 硬體等邊緣裝置上,無需依賴雲端基礎設施即可實現 AI 模型高效能、跨平台執行的挑戰。
工作原理
它作為 LiteRT 的編排層,為執行 Gemma、Llama、Phi-4 和 Qwen 等模型提供統一的 API。它利用 GPU 和 NPU 進行硬體加速以實現效能最大化,並支援多種後端。它還包含用於快速測試的 CLI,並為 Python、Kotlin、Swift、JavaScript 和 C++ 提供特定語言的 API。
適用對象
正在為 Android、iOS、Web 和桌面平台構建裝置端 GenAI 體驗的開發者,以及針對 Raspberry Pi 等 IoT 裝置進行開發的開發者。
亮點
- 跨平台支援:支援 Android、iOS、Web、桌面端和 IoT。
- 硬體加速:利用 GPU 和 NPU 加速器實現巔峰效能。
- 多模態:支援視覺和音訊輸入。
- 工具使用:包含用於代理工作流的函式呼叫 (function calling) 支援。
- 廣泛的模型支援:相容於 Gemma、Llama、Phi-4 和 Qwen 等模型。
- 多 Token 預測:支援 MTP drafter 以提高推論速度。
相關
- 專案
- 專案
- 專案
- 專案
- 專案