fikrikarim/parlor
On-device, real-time multimodal AI. Have natural voice and vision conversations with an AI that runs entirely on your machine. Powered by Gemma 4 E2B and Kokoro.
What it solves
Parlor はリアルタイムかつマルチモーダル(音声と映像)AI 会話を完全にローカルデバイス上で実行できるようにします。これにより高額なサーバーコストやクラウド依存が不要となり、ユーザーを見て聞くことができるプライベートで低遅延な AI アシスタントが実現します。
How it works
システムは FastAPI サーバーを使用し、WebSockets を介してブラウザと通信し、音声とカメラフレームをストリーミングします。主に以下の 3 つのコンポーネントを統合しています:
- Understanding: Gemma 4 E2B(LiteRT-LM 経由)で音声と映像入力を処理。
- Speech: Kokoro TTS(Mac では MLX、Linux では ONNX)でテキスト応答を音声に変換。
- Interaction: Silero VAD がブラウザ上で音声活動検出を行い、ハンズフリー操作を実現。また「バージイン」機能により、ユーザーは AI の発話途中で割り込むことが可能です。
Who it’s for
Apple Silicon Mac または対応 GPU を搭載した Linux マシンを所有し、ローカルでマルチモーダル AI を求めるユーザー向けです。特に語学学習やプライベートなオンデバイスアシスタントに関心のある方に最適です。
Highlights
- Fully Local: デバイス上だけで動作し、約 3 GB の RAM が必要です。
- Multimodal: カメラからの映像と音声を同時に処理します。
- Low Latency: 文単位の TTS ストリーミングにより、完全な応答が生成される前に再生を開始できます。
- Hands-Free: 音声活動検出(VAD)を統合し、プッシュ・トゥ・トークが不要です。