google-ai-edge/LiteRT
LiteRT, successor to TensorFlow Lite. is Google's On-device framework for high-performance ML & GenAI deployment on edge platforms, via efficient conversion, runtime, and optimization
解決的問題
LiteRT 為在邊緣裝置上部署機器學習與生成式 AI 模型提供高性能執行階段。它簡化了在行動裝置、Web 與 IoT 平台上執行推論的流程,同時最大化利用可用的硬體加速(CPU、GPU 與 NPU)。
工作原理
LiteRT 作為執行引擎,執行從 PyTorch、TensorFlow 與 Jax 等框架轉換而來的優化模型。它利用 Compiled Model API 自動化加速器選擇並處理非同步執行。對於 GenAI,它使用專用工具,例如用於 LLM 的 LiteRT-LM,以及透過 WebGPU 與 WASM 進行瀏覽器端推論的 LiteRT.js。
適用對象
為 Android、iOS、Linux、macOS、Windows 與 Web 建構端側 AI 應用程式的開發者,以及希望從 TensorFlow Lite 遷移的開發者。
亮點
- 統一的 NPU 加速: 用於存取來自各種晶片組供應商 NPU 的單一 API。
- 跨平台支援: 相容於 Android、iOS、Linux、macOS、Windows、Web 與 IoT (Raspberry Pi)。
- GenAI 就緒: 專門支援在端側部署量化後的 LLM 與擴散模型。
- Compiled Model API: 透過消除手動建立 Delegate 的需求並改進 I/O 緩衝區處理來簡化開發。
相關
- 專案
- 專案
- 專案
- 專案
- 專案