katipally/openlive

Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.

OpenLive – AI代理的本地語音與視覺層

是什麼 – OpenLive 是一個桌面應用程式,可將任何 LLM 或編碼代理(Claude、OpenAI、Gemini、Ollama 等)轉換為在您自己電腦上完全運行的語音與視覺助手。它整合了:

  • 語音活動檢測(Silero VAD)
  • 串流語音轉文字(Whisper)
  • 回合切換邏輯(Smart-Turn)
  • 文字轉語音(Kokoro 或 Supertonic,支援可選的零樣本語音克隆)
  • 可選的攝影機/螢幕擷取,用於視覺增強模型。 所有音訊處理均在 WebGPU 上本地完成;僅最終轉錄文字(以及可選的影像幀)透過正常 API 金鑰傳送至所選模型。

主要功能

  • 模型無關 – 支援您擁有金鑰的任何提供者(Anthropic、OpenAI、Google、xAI、DeepSeek、Groq、Ollama 等)。
  • 代理無關 – 可驅動支援 Agent Client Protocol(Claude Code、Codex、Cursor、OpenCode、Hermes 等)的編碼代理,作為子行程運行。
  • 語音克隆 – 录製 5–30 秒自己的聲音,本地生成克隆(ZipVoice),讓助手以該聲音說話。
  • 中斷(Barge-in) – 可隨時中斷助手;播放會在單字中間停止。
  • 視覺支援 – 每回合可傳送攝影機或螢幕幀;純文字模型可呼叫獨立的視覺模型。
  • 浮動迷你模式 – 小型始終置頂視窗,帶系統匣圖示,方便工作時快速存取。
  • 隱私優先 – 無音訊上傳;API 金鑰以加密方式儲存(AES-256-GCM),僅顯示最後四位數字。
  • 會話持久化 – 對話以 Markdown 格式儲存,可從 OpenLive UI 或代理 CLI 恢復,並包含成本/計畫清單。

典型工作流程

  1. 安裝應用(提供 macOS、Windows、Linux 二進位檔)。
  2. 在「設定 → 代理」中新增模型 API 金鑰,或安裝編碼代理 CLI。
  3. (可選)錄製一段短語音樣本以克隆您的聲音。
  4. 開始「通話」;應用監聽語音,將語音轉為文字,傳送至所選模型,串流返回模型回覆至 TTS 引擎,並在可選情況下顯示攝影機/螢幕幀。
  5. 透過語音或點擊回應代理的任何權限提示,並即時觀察計畫/成本 UI 更新。

快速上手

  • 二進位檔 – 下載適用於您作業系統的最新版本,執行安裝程式,貼上模型金鑰,點擊 開始通話
  • 從原始碼建置
    pnpm install
    pnpm desktop:dev   # 啟動 Electron + 本地伺服器
    
    您也可以透過 pnpm dev 執行 Web UI(localhost:3000),並透過 pnpm test 執行測試。

架構概覽

mic → VAD → 串流 STT → 回合結束 → 您的 AI(透過 API 或 ACP) → 串流 TTS → 扬聲器
                ↑
                └─ 攝影機/螢幕幀(可選)

除外部模型外,所有元件均在 Electron 渲染器中使用 WebGPU 執行。輕量級 WebSocket 伺服器負責回合協調並驅動 ACP 兼容的編碼代理。

倉儲結構

  • apps/desktop – Electron 框架、系統匣、迷你模式。
  • apps/web – Next.js UI + 本地語音引擎。
  • services/agent – WebSocket、ACP 驅動、語音克隆邏輯。
  • packages/* – 共用型別、模型適配器、加密 JSON 儲存。
  • docs/ARCHITECTURE.md – 更深入的管道解析。

許可證 – MIT(可自由使用、修改與分發)。


OpenLive 是一個真正的開源專案,為 AI 代理提供了缺失的語音與視覺基礎功能,讓您無需支付持續音訊費用,即可完全在本地與 LLM 或編碼助手互動。

相關

  • 專案
  • 專案
  • 專案
  • 專案