google-ai-edge/LiteRT-LM

LiteRT-LM is Google's production-ready, high-performance, open-source inference framework for deploying Large Language Models on edge devices.

解决的问题

LiteRT-LM 是一个专为在设备端运行大语言模型 (LLM) 而设计的生产级编排层。它解决了在智能手机、笔记本电脑和 IoT 硬件等边缘设备上,无需依赖云基础设施即可实现 AI 模型高性能、跨平台执行的挑战。

工作原理

它作为 LiteRT 的编排层,为执行 Gemma、Llama、Phi-4 和 Qwen 等模型提供统一的 API。它利用 GPU 和 NPU 进行硬件加速以实现性能最大化,并支持多种后端。它还包含用于快速测试的 CLI,并为 Python、Kotlin、Swift、JavaScript 和 C++ 提供特定语言的 API。

适用对象

正在为 Android、iOS、Web 和桌面平台构建设备端 GenAI 体验的开发者,以及针对 Raspberry Pi 等 IoT 设备进行开发的开发者。

亮点

  • 跨平台支持:支持 Android、iOS、Web、桌面端和 IoT。
  • 硬件加速:利用 GPU 和 NPU 加速器实现峰值性能。
  • 多模态:支持视觉和音频输入。
  • 工具使用:包含用于智能体工作流的函数调用 (function calling) 支持。
  • 广泛的模型支持:兼容 Gemma、Llama、Phi-4 和 Qwen 等模型。
  • 多 Token 预测:支持 MTP drafter 以提高推理速度。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目