katipally/openlive

Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.

OpenLive – AI代理的本地语音与视觉层

是什么 – OpenLive 是一个桌面应用程序,可将任何 LLM 或编码代理(Claude、OpenAI、Gemini、Ollama 等)转变为在您自己电脑上完全运行的语音与视觉助手。它集成了:

  • 语音活动检测(Silero VAD)
  • 流式语音转文本(Whisper)
  • 轮次切换逻辑(Smart-Turn)
  • 文本转语音(Kokoro 或 Supertonic,支持可选的零样本语音克隆)
  • 可选的摄像头/屏幕捕获,用于视觉增强模型。 所有音频处理均在 WebGPU 上本地完成;仅最终转录文本(以及可选的图像帧)通过正常 API 密钥发送至所选模型。

主要功能

  • 模型无关 – 支持您拥有密钥的任何提供商(Anthropic、OpenAI、Google、xAI、DeepSeek、Groq、Ollama 等)。
  • 代理无关 – 可驱动支持 Agent Client Protocol(Claude Code、Codex、Cursor、OpenCode、Hermes 等)的编码代理,作为子进程运行。
  • 语音克隆 – 录制 5–30 秒自己的声音,本地生成克隆(ZipVoice),让助手以该声音说话。
  • 打断(Barge-in) – 可随时中断助手;播放会在单词中间停止。
  • 视觉支持 – 每轮可发送摄像头或屏幕帧;纯文本模型可调用独立的视觉模型。
  • 浮动迷你模式 – 小型始终置顶窗口,带托盘图标,方便工作时快速访问。
  • 隐私优先 – 无音频上传;API 密钥以加密方式存储(AES-256-GCM),仅显示最后四位数字。
  • 会话持久化 – 对话以 Markdown 格式保存,可从 OpenLive UI 或代理 CLI 恢复,并包含成本/计划清单。

典型工作流程

  1. 安装应用(提供 macOS、Windows、Linux 二进制文件)。
  2. 在“设置 → 代理”中添加模型 API 密钥,或安装编码代理 CLI。
  3. (可选)录制一段短语音样本以克隆您的声音。
  4. 开始“通话”;应用监听语音,将语音转为文本,发送至所选模型,流式返回模型回复至 TTS 引擎,并在可选情况下显示摄像头/屏幕帧。
  5. 通过语音或点击回答代理的任何权限提示,并实时观察计划/成本 UI 更新。

快速上手

  • 二进制文件 – 下载适用于您操作系统的最新版本,运行安装程序,粘贴模型密钥,点击 开始通话
  • 从源码构建
    pnpm install
    pnpm desktop:dev   # 启动 Electron + 本地服务器
    
    您也可以通过 pnpm dev 运行 Web UI(localhost:3000),并通过 pnpm test 运行测试。

架构概览

mic → VAD → 流式 STT → 轮次结束 → 您的 AI(通过 API 或 ACP) → 流式 TTS → 扬声器
                ↑
                └─ 摄像头/屏幕帧(可选)

除外部模型外,所有组件均在 Electron 渲染器中使用 WebGPU 运行。轻量级 WebSocket 服务器负责轮次协调并驱动 ACP 兼容的编码代理。

仓库结构

  • apps/desktop – Electron 框架、托盘、迷你模式。
  • apps/web – Next.js UI + 本地语音引擎。
  • services/agent – WebSocket、ACP 驱动、语音克隆逻辑。
  • packages/* – 共享类型、模型适配器、加密 JSON 存储。
  • docs/ARCHITECTURE.md – 更深入的管道解析。

许可证 – MIT(可自由使用、修改和分发)。


OpenLive 是一个真正的开源项目,为 AI 代理提供了缺失的语音与视觉基础功能,让您无需支付持续音频费用,即可完全在本地与 LLM 或编码助手交互。

相关

  • 项目
  • 项目
  • 项目
  • 项目