fikrikarim/parlor

On-device, real-time multimodal AI with features similar to GPT-Live

解决的问题

Parlor 提供类似于 GPT-Live 的完全在设备端运行的实时多模态 AI 体验。它允许用户通过语音和摄像头与 AI 进行交互,而无需依赖云服务,在确保低延迟和隐私的同时,支持插话(中断 AI)和免手操作轮替等复杂交互。

工作原理

Parlor 使用级联系统来处理多模态输入并生成响应:

  1. 输入处理:基于浏览器的前端捕获音频 (PCM) 和摄像头帧 (JPEG),通过 WebSockets 发送到 FastAPI 服务器。
  2. 轮替检测:Silero VAD 处理初始静音检测,smart-turn-v3 决定用户是否真正完成了思考,以避免过早中断。
  3. 核心模型:Gemma 4 (通过 llama.cpp) 处理音频和视觉数据以生成文本回复。
  4. 语音生成:Kokoro TTS 将文本转换为语音,逐句流式传输到浏览器进行即时播放。
  5. 动作处理:一个独立的语法强制 JSON 头部管理非语音动作(如定时器或模式切换),使控制标记不会泄露到语音音频中。
  6. 可选研究:如果配置了 API 密钥,后台推理器可以在对话进行时使用前沿模型进行网络研究。

适用对象

想要在 Apple Silicon (MacBook M3 Pro) 或带有 GPU 的 Linux 上运行高性能本地多模态 AI 助手的开发者和 AI 爱好者,以及更倾向于使用专有语音 AI 服务的自托管替代方案的人士。

亮点

  • 完全本地化:使用 Gemma 4 和 Kokoro TTS 在设备端 100% 运行。
  • 实时交互:支持插话以及文本转录和音频的低延迟流式传输。
  • 免手操作:使用先进的轮替检测技术来区分思考中的停顿和轮替结束。
  • 专业模式:包括用于连续口译的实时翻译模式和用于静默记录的“仅监听”模式。
  • 集成工具:内置对定时器和后台网络研究的支持。

相关