NightMean/OlliteRT
Turn your Android phone into an OpenAI-compatible LLM inference server - Fully local, private and Open Source
解决的问题
OlliteRT 允许用户将 Android 设备转变为一个完全本地化、私密的 LLM 服务器。它通过利用移动设备自身的 CPU 和 GPU 来托管模型,从而消除了对云订阅、API 密钥和昂贵 GPU 硬件的需求,这些模型可通过本地网络访问。
工作原理
该应用使用 Google 的 LiteRT-LM 运行时在 Android 上执行模型。它将此运行时封装为一个 OpenAI 兼容的 HTTP API 服务器,使任何能够与 OpenAI API 通信的软件(如 Open WebUI 或 Home Assistant)都可以向 Android 手机发送请求,而非依赖云服务。
适用人群
专为希望本地运行 LLM 以保护隐私、节省成本,或重新利用旧手机硬件作为低功耗 AI 服务器的 Android 用户(Android 12+,arm64-v8a)设计。
主要亮点
- 广泛兼容性:支持 OpenAI 和 Anthropic 兼容 API,可与大量现有 AI 客户端兼容。
- 多模态能力:支持视觉、音频和“思考”模型(例如 Gemma 4)。
- 低功耗:相比传统 GPU 服务器,功耗显著更低(5–10W)。
- 集成工具:内置基准测试、详细活动日志以及 Prometheus 指标,可通过 Grafana 监控。
- 灵活的模型管理:支持从 HuggingFace 一键下载或导入自定义
.litertlm文件。
相关
- 项目
- 项目
- 项目
- 项目