katipally/openlive

Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.

OpenLive – AI 에이전트용 로컬 음성 및 시각 레이어

무엇인가요 – OpenLive는 어떤 LLM 또는 코딩 에이전트(Claude, OpenAI, Gemini, Ollama 등)라도 당신의 컴퓨터에서 완전히 로컬로 작동하는 음성 및 시각 보조자로 전환하는 데스크톱 앱입니다. 다음을 통합합니다:

  • 음성 활동 탐지(Silero VAD)
  • 스트리밍 음성-텍스트 변환(Whisper)
  • 턴 전환 로직(Smart-Turn)
  • 텍스트-음성 변환(Kokoro 또는 Supertonic, 옵션으로 제로샷 음성 클론)
  • 옵션으로 카메라/스크린 캡처 (시각 기능 모델용) 모든 오디오 처리는 WebGPU를 통해 로컬에서 수행되며, 최종 텍스트(및 선택적 이미지 프레임)만 선택한 모델에 일반 API 키를 통해 전송됩니다.

주요 기능

  • 모델 독립성 – Anthropic, OpenAI, Google, xAI, DeepSeek, Groq, Ollama 등 API 키가 있는 모든 제공자와 호환.
  • 에이전트 독립성 – Claude Code, Codex, Cursor, OpenCode, Hermes 등 Agent Client Protocol를 지원하는 코딩 에이전트를 하위 프로세스로 제어 가능.
  • 음성 클론 – 5~30초의 자신의 목소리 샘플을 녹음하고, 로컬에서 클론(ZipVoice)을 생성해 어시스턴트가 그 목소리로 말하게 할 수 있음.
  • 바지인(Barge-in) – 언제든지 어시스턴트를 중단할 수 있으며, 재생은 단어 중간에 멈춤.
  • 시각 지원 – 각 턴마다 카메라 또는 스크린 프레임을 전송 가능. 텍스트 전용 모델은 별도의 시각 모델을 호출할 수 있음.
  • 플로팅 미니 모드 – 작업 중 빠르게 접근할 수 있는 항상 위에 표시되는 작은 창과 트레이 아이콘.
  • 개인정보 최우선 – 오디오가 업로드되지 않음. API 키는 암호화(AES-256-GCM)되어 저장되며, 표시되는 것은 마지막 4자리만.
  • 세션 지속성 – 대화는 마크다운 형식으로 저장되며, OpenLive UI 또는 에이전트 CLI에서 재개 가능. 비용/플랜 체크리스트 포함.

일반 워크플로우

  1. 앱 설치 (macOS, Windows, Linux 바이너리 제공).
  2. 설정 → 에이전트에서 모델 API 키 추가 또는 코딩 에이전트 CLI 설치.
  3. (옵션) 자신의 목소리 클론을 위해 짧은 음성 샘플 녹음.
  4. "통화" 시작. 앱이 음성을 듣고 음성-텍스트 변환 후 선택한 뇌 모델에 전달. 모델의 응답을 스트리밍으로 TTS 엔진에 전달하고, 음성으로 재생하면서 선택적으로 카메라/스크린 프레임 표시.
  5. 에이전트의 권한 프롬프트에 음성 또는 탭으로 응답하고, 계획/비용 UI가 실시간으로 업데이트되는 것을 확인.

시작하기

  • 바이너리 – OS용 최신 릴리스 다운로드, 설치 프로그램 실행, 모델 키 붙여넣기, 통화 시작 클릭.
  • 소스에서
    pnpm install
    pnpm desktop:dev   # Electron + 로컬 서버 시작
    
    pnpm dev로 웹 UI(localhost:3000) 실행 가능. 테스트는 pnpm test로 실행 가능.

아키텍처 개요

mic → VAD → 스트리밍 STT → 턴 종료 → 선택한 AI(API 또는 ACP 경유) → 스트리밍 TTS → 스피커
                ↑
                └─ 카메라/스크린 프레임 (옵션)

외부 모델을 제외한 모든 구성 요소는 WebGPU를 사용한 Electron 렌더러에서 실행됩니다. 가벼운 WebSocket 서버가 턴을 중개하고 ACP 호환 코딩 에이전트를 제어합니다.

리포지토리 구조

  • apps/desktop – Electron 쉘, 트레이, 미니 모드.
  • apps/web – Next.js UI + 로컬 음성 엔진.
  • services/agent – WebSocket, ACP 드라이버, 음성 클론 로직.
  • packages/* – 공유 타입, 모델 어댑터, 암호화된 JSON 저장소.
  • docs/ARCHITECTURE.md – 파이프라인에 대한 심층 설명.

라이선스 – MIT (사용, 수정, 재배포 자유).


OpenLive는 진정한 오픈소스 프로젝트로, AI 에이전트에 필요한 음성 및 시각 기반 기능을 제공하여, 지속적인 오디오 요금 없이 완전히 로컬에서 LLM 또는 코딩 어시스턴트와 상호작용할 수 있게 합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트