katipally/openlive
Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.
OpenLive – AI 에이전트용 로컬 음성 및 시각 레이어
무엇인가요 – OpenLive는 어떤 LLM 또는 코딩 에이전트(Claude, OpenAI, Gemini, Ollama 등)라도 당신의 컴퓨터에서 완전히 로컬로 작동하는 음성 및 시각 보조자로 전환하는 데스크톱 앱입니다. 다음을 통합합니다:
- 음성 활동 탐지(Silero VAD)
- 스트리밍 음성-텍스트 변환(Whisper)
- 턴 전환 로직(Smart-Turn)
- 텍스트-음성 변환(Kokoro 또는 Supertonic, 옵션으로 제로샷 음성 클론)
- 옵션으로 카메라/스크린 캡처 (시각 기능 모델용) 모든 오디오 처리는 WebGPU를 통해 로컬에서 수행되며, 최종 텍스트(및 선택적 이미지 프레임)만 선택한 모델에 일반 API 키를 통해 전송됩니다.
주요 기능
- 모델 독립성 – Anthropic, OpenAI, Google, xAI, DeepSeek, Groq, Ollama 등 API 키가 있는 모든 제공자와 호환.
- 에이전트 독립성 – Claude Code, Codex, Cursor, OpenCode, Hermes 등 Agent Client Protocol를 지원하는 코딩 에이전트를 하위 프로세스로 제어 가능.
- 음성 클론 – 5~30초의 자신의 목소리 샘플을 녹음하고, 로컬에서 클론(ZipVoice)을 생성해 어시스턴트가 그 목소리로 말하게 할 수 있음.
- 바지인(Barge-in) – 언제든지 어시스턴트를 중단할 수 있으며, 재생은 단어 중간에 멈춤.
- 시각 지원 – 각 턴마다 카메라 또는 스크린 프레임을 전송 가능. 텍스트 전용 모델은 별도의 시각 모델을 호출할 수 있음.
- 플로팅 미니 모드 – 작업 중 빠르게 접근할 수 있는 항상 위에 표시되는 작은 창과 트레이 아이콘.
- 개인정보 최우선 – 오디오가 업로드되지 않음. API 키는 암호화(AES-256-GCM)되어 저장되며, 표시되는 것은 마지막 4자리만.
- 세션 지속성 – 대화는 마크다운 형식으로 저장되며, OpenLive UI 또는 에이전트 CLI에서 재개 가능. 비용/플랜 체크리스트 포함.
일반 워크플로우
- 앱 설치 (macOS, Windows, Linux 바이너리 제공).
- 설정 → 에이전트에서 모델 API 키 추가 또는 코딩 에이전트 CLI 설치.
- (옵션) 자신의 목소리 클론을 위해 짧은 음성 샘플 녹음.
- "통화" 시작. 앱이 음성을 듣고 음성-텍스트 변환 후 선택한 뇌 모델에 전달. 모델의 응답을 스트리밍으로 TTS 엔진에 전달하고, 음성으로 재생하면서 선택적으로 카메라/스크린 프레임 표시.
- 에이전트의 권한 프롬프트에 음성 또는 탭으로 응답하고, 계획/비용 UI가 실시간으로 업데이트되는 것을 확인.
시작하기
- 바이너리 – OS용 최신 릴리스 다운로드, 설치 프로그램 실행, 모델 키 붙여넣기, 통화 시작 클릭.
- 소스에서 –
pnpm install pnpm desktop:dev # Electron + 로컬 서버 시작pnpm dev로 웹 UI(localhost:3000) 실행 가능. 테스트는pnpm test로 실행 가능.
아키텍처 개요
mic → VAD → 스트리밍 STT → 턴 종료 → 선택한 AI(API 또는 ACP 경유) → 스트리밍 TTS → 스피커
↑
└─ 카메라/스크린 프레임 (옵션)
외부 모델을 제외한 모든 구성 요소는 WebGPU를 사용한 Electron 렌더러에서 실행됩니다. 가벼운 WebSocket 서버가 턴을 중개하고 ACP 호환 코딩 에이전트를 제어합니다.
리포지토리 구조
apps/desktop– Electron 쉘, 트레이, 미니 모드.apps/web– Next.js UI + 로컬 음성 엔진.services/agent– WebSocket, ACP 드라이버, 음성 클론 로직.packages/*– 공유 타입, 모델 어댑터, 암호화된 JSON 저장소.docs/ARCHITECTURE.md– 파이프라인에 대한 심층 설명.
라이선스 – MIT (사용, 수정, 재배포 자유).
OpenLive는 진정한 오픈소스 프로젝트로, AI 에이전트에 필요한 음성 및 시각 기반 기능을 제공하여, 지속적인 오디오 요금 없이 완전히 로컬에서 LLM 또는 코딩 어시스턴트와 상호작용할 수 있게 합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트