fikrikarim/parlor

On-device, real-time multimodal AI. Have natural voice and vision conversations with an AI that runs entirely on your machine. Powered by Gemma 4 E2B and Kokoro.

What it solves

Parlor는 실시간 멀티모달(음성 및 시각) AI 대화를 완전히 로컬 디바이스에서 실행할 수 있게 합니다. 이를 통해 비싼 서버 비용과 클라우드 의존성을 없애고, 사용자를 보고 들을 수 있는 개인적이고 저지연 AI 어시스턴트를 구현할 수 있습니다.

How it works

시스템은 FastAPI 서버를 사용하고 WebSockets를 통해 브라우저와 통신하여 오디오와 카메라 프레임을 스트리밍합니다. 세 가지 주요 구성 요소를 통합합니다:

  • Understanding: Gemma 4 E2B(LiteRT-LM을 통해)로 음성 및 시각 입력을 처리합니다.
  • Speech: Kokoro TTS(Mac에서는 MLX, Linux에서는 ONNX 사용)로 텍스트 응답을 오디오로 변환합니다.
  • Interaction: Silero VAD가 브라우저에서 음성 활동을 감지하여 핸즈프리 사용을 가능하게 하고, 시스템은 "바지인"을 지원해 사용자가 AI의 문장을 중간에 끊을 수 있습니다.

Who it’s for

Apple Silicon Mac 또는 지원 GPU가 장착된 Linux 머신을 보유하고 로컬 멀티모달 AI를 원하는 사용자, 특히 언어 학습이나 개인용 온디바이스 어시스턴트에 관심이 있는 사람들을 위해 설계되었습니다.

Highlights

  • Fully Local: 디바이스에서만 실행되며 약 3GB RAM이 필요합니다.
  • Multimodal: 카메라에서 들어오는 음성 및 시각 입력을 동시에 처리합니다.
  • Low Latency: 문장 수준 TTS 스트리밍을 제공해 전체 응답이 생성되기 전에 재생을 시작합니다.
  • Hands-Free: 음성 활동 감지(VAD)를 통합해 푸시‑투‑톡이 필요 없습니다.