fikrikarim/parlor
On-device, real-time multimodal AI with features similar to GPT-Live
解决的问题
Parlor 提供类似于 GPT-Live 的完全在设备端运行的实时多模态 AI 体验。它允许用户通过语音和摄像头与 AI 进行交互,而无需依赖云服务,在确保低延迟和隐私的同时,支持插话(中断 AI)和免手操作轮替等复杂交互。
工作原理
Parlor 使用级联系统来处理多模态输入并生成响应:
- 输入处理:基于浏览器的前端捕获音频 (PCM) 和摄像头帧 (JPEG),通过 WebSockets 发送到 FastAPI 服务器。
- 轮替检测:Silero VAD 处理初始静音检测,
smart-turn-v3决定用户是否真正完成了思考,以避免过早中断。 - 核心模型:Gemma 4 (通过 llama.cpp) 处理音频和视觉数据以生成文本回复。
- 语音生成:Kokoro TTS 将文本转换为语音,逐句流式传输到浏览器进行即时播放。
- 动作处理:一个独立的语法强制 JSON 头部管理非语音动作(如定时器或模式切换),使控制标记不会泄露到语音音频中。
- 可选研究:如果配置了 API 密钥,后台推理器可以在对话进行时使用前沿模型进行网络研究。
适用对象
想要在 Apple Silicon (MacBook M3 Pro) 或带有 GPU 的 Linux 上运行高性能本地多模态 AI 助手的开发者和 AI 爱好者,以及更倾向于使用专有语音 AI 服务的自托管替代方案的人士。
亮点
- 完全本地化:使用 Gemma 4 和 Kokoro TTS 在设备端 100% 运行。
- 实时交互:支持插话以及文本转录和音频的低延迟流式传输。
- 免手操作:使用先进的轮替检测技术来区分思考中的停顿和轮替结束。
- 专业模式:包括用于连续口译的实时翻译模式和用于静默记录的“仅监听”模式。
- 集成工具:内置对定时器和后台网络研究的支持。
相关
- 项目
- 项目
- Dispatch
- Dispatch
- 项目