fikrikarim/parlor

On-device, real-time multimodal AI. Have natural voice and vision conversations with an AI that runs entirely on your machine. Powered by Gemma 4 E2B and Kokoro.

What it solves

Parlor はリアルタイムかつマルチモーダル(音声と映像)AI 会話を完全にローカルデバイス上で実行できるようにします。これにより高額なサーバーコストやクラウド依存が不要となり、ユーザーを見て聞くことができるプライベートで低遅延な AI アシスタントが実現します。

How it works

システムは FastAPI サーバーを使用し、WebSockets を介してブラウザと通信し、音声とカメラフレームをストリーミングします。主に以下の 3 つのコンポーネントを統合しています:

  • Understanding: Gemma 4 E2B(LiteRT-LM 経由)で音声と映像入力を処理。
  • Speech: Kokoro TTS(Mac では MLX、Linux では ONNX)でテキスト応答を音声に変換。
  • Interaction: Silero VAD がブラウザ上で音声活動検出を行い、ハンズフリー操作を実現。また「バージイン」機能により、ユーザーは AI の発話途中で割り込むことが可能です。

Who it’s for

Apple Silicon Mac または対応 GPU を搭載した Linux マシンを所有し、ローカルでマルチモーダル AI を求めるユーザー向けです。特に語学学習やプライベートなオンデバイスアシスタントに関心のある方に最適です。

Highlights

  • Fully Local: デバイス上だけで動作し、約 3 GB の RAM が必要です。
  • Multimodal: カメラからの映像と音声を同時に処理します。
  • Low Latency: 文単位の TTS ストリーミングにより、完全な応答が生成される前に再生を開始できます。
  • Hands-Free: 音声活動検出(VAD)を統合し、プッシュ・トゥ・トークが不要です。