google-ai-edge/LiteRT

LiteRT, successor to TensorFlow Lite. is Google's On-device framework for high-performance ML & GenAI deployment on edge platforms, via efficient conversion, runtime, and optimization

解决的问题

LiteRT 为在边缘设备上部署机器学习和生成式 AI 模型提供高性能运行时。它简化了在移动端、Web 和 IoT 平台上运行推理的过程,同时最大限度地利用可用的硬件加速(CPU、GPU 和 NPU)。

工作原理

LiteRT 作为执行引擎,运行从 PyTorch、TensorFlow 和 Jax 等框架转换而来的优化模型。它利用 Compiled Model API 实现加速器选择的自动化并处理异步执行。对于 GenAI,它使用专门的工具,例如用于 LLM 的 LiteRT-LM,以及通过 WebGPU 和 WASM 进行基于浏览器的推理的 LiteRT.js。

适用对象

为 Android、iOS、Linux、macOS、Windows 和 Web 构建端侧 AI 应用的开发者,以及希望从 TensorFlow Lite 迁移的开发者。

亮点

  • 统一的 NPU 加速: 用于访问来自各种芯片组供应商 NPU 的单一 API。
  • 跨平台支持: 兼容 Android、iOS、Linux、macOS、Windows、Web 和 IoT (Raspberry Pi)。
  • GenAI 就绪: 专门支持在端侧部署量化后的 LLM 和扩散模型。
  • Compiled Model API: 通过消除手动创建 Delegate 的需求并改进 I/O 缓冲区处理来简化开发。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目