fikrikarim/parlor
On-device, real-time multimodal AI. Have natural voice and vision conversations with an AI that runs entirely on your machine. Powered by Gemma 4 E2B and Kokoro.
What it solves
Parlor 让实时、多模态(语音与视觉)AI 对话能够完全在本地设备上运行。这消除了昂贵的服务器成本和云端依赖,使得私密、低延迟且能够看见和听见用户的 AI 助手成为可能。
How it works
系统使用 FastAPI 服务器,通过 WebSockets 与浏览器通信,以流式传输音频和摄像头帧。它整合了三个主要组件:
- Understanding: Gemma 4 E2B(通过 LiteRT-LM)处理语音和视觉输入。
- Speech: Kokoro TTS(在 Mac 上使用 MLX,Linux 上使用 ONNX)将文本响应转换回音频。
- Interaction: Silero VAD 在浏览器中进行语音活动检测,支持免提使用,系统还支持“插话”,允许用户在 AI 句子未说完时中断。
Who it’s for
它面向拥有 Apple Silicon Mac 或支持 GPU 的 Linux 机器的用户,想要本地多模态 AI,尤其是对语言学习或私密设备助理感兴趣的人。
Highlights
- Fully Local: 完全在设备上运行,约需 3 GB RAM。
- Multimodal: 同时处理来自摄像头的语音和视觉输入。
- Low Latency: 具备句子级别的 TTS 流式播放,在完整响应生成前即可开始播放。
- Hands-Free: 集成语音活动检测(VAD),无需按键说话。