google-ai-edge/LiteRT
LiteRT, successor to TensorFlow Lite. is Google's On-device framework for high-performance ML & GenAI deployment on edge platforms, via efficient conversion, runtime, and optimization
解决的问题
LiteRT 为在边缘设备上部署机器学习和生成式 AI 模型提供高性能运行时。它简化了在移动端、Web 和 IoT 平台上运行推理的过程,同时最大限度地利用可用的硬件加速(CPU、GPU 和 NPU)。
工作原理
LiteRT 作为执行引擎,运行从 PyTorch、TensorFlow 和 Jax 等框架转换而来的优化模型。它利用 Compiled Model API 实现加速器选择的自动化并处理异步执行。对于 GenAI,它使用专门的工具,例如用于 LLM 的 LiteRT-LM,以及通过 WebGPU 和 WASM 进行基于浏览器的推理的 LiteRT.js。
适用对象
为 Android、iOS、Linux、macOS、Windows 和 Web 构建端侧 AI 应用的开发者,以及希望从 TensorFlow Lite 迁移的开发者。
亮点
- 统一的 NPU 加速: 用于访问来自各种芯片组供应商 NPU 的单一 API。
- 跨平台支持: 兼容 Android、iOS、Linux、macOS、Windows、Web 和 IoT (Raspberry Pi)。
- GenAI 就绪: 专门支持在端侧部署量化后的 LLM 和扩散模型。
- Compiled Model API: 通过消除手动创建 Delegate 的需求并改进 I/O 缓冲区处理来简化开发。
相关
- 项目
- 项目
- 项目
- 项目
- 项目