katipally/openlive
Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.
OpenLive – AI代理的本地語音與視覺層
是什麼 – OpenLive 是一個桌面應用程式,可將任何 LLM 或編碼代理(Claude、OpenAI、Gemini、Ollama 等)轉換為在您自己電腦上完全運行的語音與視覺助手。它整合了:
- 語音活動檢測(Silero VAD)
- 串流語音轉文字(Whisper)
- 回合切換邏輯(Smart-Turn)
- 文字轉語音(Kokoro 或 Supertonic,支援可選的零樣本語音克隆)
- 可選的攝影機/螢幕擷取,用於視覺增強模型。 所有音訊處理均在 WebGPU 上本地完成;僅最終轉錄文字(以及可選的影像幀)透過正常 API 金鑰傳送至所選模型。
主要功能
- 模型無關 – 支援您擁有金鑰的任何提供者(Anthropic、OpenAI、Google、xAI、DeepSeek、Groq、Ollama 等)。
- 代理無關 – 可驅動支援 Agent Client Protocol(Claude Code、Codex、Cursor、OpenCode、Hermes 等)的編碼代理,作為子行程運行。
- 語音克隆 – 录製 5–30 秒自己的聲音,本地生成克隆(ZipVoice),讓助手以該聲音說話。
- 中斷(Barge-in) – 可隨時中斷助手;播放會在單字中間停止。
- 視覺支援 – 每回合可傳送攝影機或螢幕幀;純文字模型可呼叫獨立的視覺模型。
- 浮動迷你模式 – 小型始終置頂視窗,帶系統匣圖示,方便工作時快速存取。
- 隱私優先 – 無音訊上傳;API 金鑰以加密方式儲存(AES-256-GCM),僅顯示最後四位數字。
- 會話持久化 – 對話以 Markdown 格式儲存,可從 OpenLive UI 或代理 CLI 恢復,並包含成本/計畫清單。
典型工作流程
- 安裝應用(提供 macOS、Windows、Linux 二進位檔)。
- 在「設定 → 代理」中新增模型 API 金鑰,或安裝編碼代理 CLI。
- (可選)錄製一段短語音樣本以克隆您的聲音。
- 開始「通話」;應用監聽語音,將語音轉為文字,傳送至所選模型,串流返回模型回覆至 TTS 引擎,並在可選情況下顯示攝影機/螢幕幀。
- 透過語音或點擊回應代理的任何權限提示,並即時觀察計畫/成本 UI 更新。
快速上手
- 二進位檔 – 下載適用於您作業系統的最新版本,執行安裝程式,貼上模型金鑰,點擊 開始通話。
- 從原始碼建置 –
您也可以透過pnpm install pnpm desktop:dev # 啟動 Electron + 本地伺服器pnpm dev執行 Web UI(localhost:3000),並透過pnpm test執行測試。
架構概覽
mic → VAD → 串流 STT → 回合結束 → 您的 AI(透過 API 或 ACP) → 串流 TTS → 扬聲器
↑
└─ 攝影機/螢幕幀(可選)
除外部模型外,所有元件均在 Electron 渲染器中使用 WebGPU 執行。輕量級 WebSocket 伺服器負責回合協調並驅動 ACP 兼容的編碼代理。
倉儲結構
apps/desktop– Electron 框架、系統匣、迷你模式。apps/web– Next.js UI + 本地語音引擎。services/agent– WebSocket、ACP 驅動、語音克隆邏輯。packages/*– 共用型別、模型適配器、加密 JSON 儲存。docs/ARCHITECTURE.md– 更深入的管道解析。
許可證 – MIT(可自由使用、修改與分發)。
OpenLive 是一個真正的開源專案,為 AI 代理提供了缺失的語音與視覺基礎功能,讓您無需支付持續音訊費用,即可完全在本地與 LLM 或編碼助手互動。
相關
- 專案
- 專案
- 專案
- 專案