fikrikarim/parlor

On-device, real-time multimodal AI with features similar to GPT-Live

解決的問題

Parlor 提供類似於 GPT-Live 的完全在裝置端運行的即時多模態 AI 體驗。它允許使用者透過語音和攝影機與 AI 進行互動,而無需依賴雲端服務,在確保低延遲與隱私的同時,支援插話(中斷 AI)與免手操作輪替等複雜互動。

工作原理

Parlor 使用級聯系統來處理多模態輸入並生成回應:

  1. 輸入處理:基於瀏覽器的前端擷取音訊 (PCM) 與攝影機影格 (JPEG),透過 WebSockets 發送到 FastAPI 伺服器。
  2. 輪替檢測:Silero VAD 處理初始靜音檢測,smart-turn-v3 判斷使用者是否真正完成了思考,以避免過早中斷。
  3. 核心模型:Gemma 4 (透過 llama.cpp) 處理音訊與視覺數據以生成文本回覆。
  4. 語音生成:Kokoro TTS 將文本轉換為語音,逐句串流傳輸到瀏覽器進行即時播放。
  5. 動作處理:一個獨立的語法強制 JSON 標頭管理非語音動作(如定時器或模式切換),使控制標記不會洩漏到語音音訊中。
  6. 選用研究:如果配置了 API 金鑰,後台推理器可以在對話進行時使用前沿模型進行網路研究。

適用對象

想要在 Apple Silicon (MacBook M3 Pro) 或配備 GPU 的 Linux 上執行高效能本地多模態 AI 助手的開發者與 AI 愛好者,以及更偏好專有語音 AI 服務之自託管替代方案的人士。

亮點

  • 完全本地化:使用 Gemma 4 與 Kokoro TTS 在裝置端 100% 執行。
  • 即時互動:支援插話以及文本轉錄與音訊的低延遲串流傳輸。
  • 免手操作:使用先進的輪替檢測技術來區分思考中的停頓與輪替結束。
  • 專業模式:包括用於連續口譯的即時翻譯模式與用於靜默記錄的「僅聆聽」模式。
  • 整合工具:內建對定時器與後台網路研究的支援。

相關