fikrikarim/parlor
On-device, real-time multimodal AI. Have natural voice and vision conversations with an AI that runs entirely on your machine. Powered by Gemma 4 E2B and Kokoro.
What it solves
Parlor 讓即時、多模態(語音與視覺)AI 對話能完全在本地裝置上執行。這消除了昂貴的伺服器成本與雲端依賴,使得私密、低延遲且能看見與聽見使用者的 AI 助手成為可能。
How it works
系統使用 FastAPI 伺服器,透過 WebSockets 與瀏覽器通訊,以串流音訊與相機畫格。它整合了三個主要元件:
- Understanding: Gemma 4 E2B(透過 LiteRT-LM)處理語音與視覺輸入。
- Speech: Kokoro TTS(在 Mac 上使用 MLX,Linux 上使用 ONNX)將文字回應轉換回音訊。
- Interaction: Silero VAD 在瀏覽器中負責語音活動偵測,支援免提使用,且系統支援「插話」功能,讓使用者可在 AI 句子尚未說完時中斷。
Who it’s for
此方案適用於擁有 Apple Silicon Mac 或具支援 GPU 的 Linux 機器,且想要本地多模態 AI 的使用者,特別是對語言學習或私密裝置上助理有需求的人。
Highlights
- Fully Local: 完全在裝置上執行,約需 3 GB 記憶體。
- Multimodal: 同時處理來自相機的語音與視覺輸入。
- Low Latency: 具備句子層級的 TTS 串流,能在完整回應產生前即開始播放。
- Hands-Free: 整合語音活動偵測(VAD),免除按鍵說話的需求。