fikrikarim/parlor

On-device, real-time multimodal AI with features similar to GPT-Live

해결하는 문제

Parlor는 GPT-Live와 유사한 완전 온디바이스 실시간 멀티모달 AI 경험을 제공합니다. 클라우드 서비스에 의존하지 않고 음성과 카메라를 통해 AI와 상호작용할 수 있어, 저지연 및 개인정보 보호를 보장하는 동시에 바지인(AI의 말을 가로막는 것) 및 핸즈프리 턴 테이킹과 같은 복잡한 상호작용을 지원합니다.

작동 원리

Parlor는 카스케이드 시스템을 사용하여 멀티모달 입력을 처리하고 응답을 생성합니다:

  1. 입력 처리: 브라우저 기반 프론트엔드가 오디오(PCM) 및 카메라 프레임(JPEG)을 캡처하여 WebSockets를 통해 FastAPI 서버로 전송합니다.
  2. 턴 감지: Silero VAD가 초기 무음 감지를 처리하고, smart-turn-v3가 사용자가 실제로 생각을 마쳤는지 판단하여 조기 중단을 방지합니다.
  3. 코어 모델: Gemma 4(llama.cpp를 통해)가 오디오 및 시각 데이터를 처리하여 텍스트 답변을 생성합니다.
  4. 음성 생성: Kokoro TTS가 텍스트를 음성으로 변환하여 즉각적인 재생을 위해 문장 단위로 브라우저에 스트리밍합니다.
  5. 액션 처리: 제어용 마크업이 음성에 섞이지 않도록 별도의 문법 강제 JSON 헤드가 비음성 액션(타이머 또는 모드 전환 등)을 관리합니다.
  6. 옵션 리서치: API 키가 구성된 경우, 대화가 진행되는 동안 백그라운드 Reasoner가 프론티어 모델을 사용하여 웹 리서치를 수행할 수 있습니다.

대상 사용자

Apple Silicon (MacBook M3 Pro) 또는 GPU가 있는 Linux에서 실행되는 고성능 로컬 멀티모달 AI 어시스턴트를 원하는 개발자 및 AI 애호가, 그리고 독점적인 음성 AI 서비스의 셀프 호스팅 대안을 선호하는 분들.

주요 특징

  • 완전 로컬: Gemma 4와 Kokoro TTS를 사용하여 100% 온디바이스로 실행됩니다.
  • 실시간 상호작용: 바지인 및 텍스트와 오디오 모두에 대한 저지연 스트리밍을 지원합니다.
  • 핸즈프리: 고급 턴 감지 기능을 사용하여 생각 중의 일시 정지와 턴의 종료를 구분합니다.
  • 특화 모드: 연속 통역을 위한 라이브 번역 모드와 조용한 기록을 위한 "듣기 전용" 모드를 포함합니다.
  • 통합 도구: 타이머 및 백그라운드 웹 리서치에 대한 내장 지원을 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • Dispatch
  • Dispatch
  • 프로젝트