jegly/Box

The most advanced, fully offline client-side AI suite on Android today.

什么是 Box

Box 是一款 Android 应用程序,将大量本地设备 AI 功能带到了手机上。它最初是 Google 的 AI Edge Gallery 的一个分支,现已发展为功能丰富、安全强化的套件,可在本地运行,无需互联网连接。


核心理念

  • 本地推理 – 所有模型(大型语言模型、视觉模型、扩散生成器、语音转文本、文本转语音等)均存储并运行在手机的 CPU、GPU 或专用 NPU(高通、谷歌 Tensor、联发科等)上。
  • 隐私优先 – 不需要调用云端;聊天记录已加密,可使用生物识别锁保护应用,且已移除谷歌拥有的遥测服务(Firebase、Clearcut)。
  • 一站式 AI 工具箱 – 应用内置数十个模型,支持聊天、图像生成、图像超分辨率、文档分析、人脸识别、音乐生成、多语言语音,以及为低视力用户设计的语音相机助手。

主要功能(如 README 所列)

类别 亮点
LLM 聊天 通过 llama.cpp 支持 GGUF 格式模型;包含混合注意力模型(如 Qwen 3.5‑0.8B)、推理导向模型(Phi‑4‑mini‑reasoning)和大型多模态模型(Gemma‑4‑12B)。在硬件允许的情况下,可通过 LiteRT 和 Vulkan 实现 GPU 加速。
视觉与多模态 “图像提问”功能支持 SmolVLM2、InternVL3 和基于 Gemini 的模型。Box Assist 提供语音相机辅助(物体描述、读取收据、障碍物提醒),专为盲人/低视力用户设计。
图像生成 本地扩散模型:Bonsai Image 4B(FLUX.2 klein)、FLUX 2 klein、Z‑Image Turbo。图像完全离线生成;可选 EDSR ×4 超分辨率。
音频 语音转语音聊天(语音模式)、多语言 STT(SenseVoice)、本地 TTS(Supertonic),以及音乐/声音生成。
文档分析 支持 PDF/TXT 导入、OCR、去模糊、去噪、扫描页扁平化、人像素描转换。
增强功能 超分辨率、人脸识别、照片擦除/修复、生物识别锁、加密 SQLite(SQLCipher)、防点击劫持、仅离线运行。
硬件加速 LiteRT 引擎支持 NPU(高通 8 Gen 2/3/Elite、谷歌 Tensor G5/G6、联发科),Vulkan GPU 加速适用于 GGUF 模型,CPU 降级备用。
国际化 UI 支持英文、法文、葡萄牙文(巴西)、德文、简体中文;多语言语音模型支持 24 种语言。
可访问性 色盲友好主题、高对比度调色板、兼容 TalkBack,以及 Box Assist 语音相机模式。

如何获取

  1. 从最新发布页面下载 APK(例如 Box v3.4.5)。
  2. 对于无 Google 服务的设备(LineageOS、GrapheneOS、CalyxOS),请使用 custom-rom-support APK。
  3. 可选通过 Obtainium 安装 – 添加仓库 URL(https://github.com/jegly/Box)并筛选 APK 名称(Maincustom-rom-support)。
  4. 应用内自带更新功能;也可在 设置 → 检查更新 手动查看更新。

许可与来源

  • 许可证:Apache 2.0(参见 LICENSE)。
  • 起源:Google AI Edge Gallery 的分支(与 Google 无关联)。该项目在上游基础上新增了 50+ 项功能,并停止合并上游更新。
  • 版本控制:上游版本显示为 1.0.15;Box 自身发布使用标签(如 v3.4.5)。

哪些人可能使用它?

  • 高级用户:希望在 Android 手机上拥有完全离线的 AI 助手,尤其是配备高端 NPU 的用户。
  • 无障碍倡导者:寻找为盲人或低视力用户设计的语音相机辅助功能。
  • 开发者 / 研究人员:对本地模型部署、硬件加速或在无云后端环境下测试 GGUF 模型感兴趣的人。
  • 注重隐私的用户:希望使用 AI 功能但不接受任何遥测数据的人。

快速总结

Box 将现代 Android 手机转变为一个自包含的 AI 工作站:聊天、图像生成、音频处理和视觉辅助均在本地运行,支持可选硬件加速,且高度重视安全与离线操作。它是一款真正活跃维护的开源项目,是移动 AI 领域的典范之作。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目