katipally/openlive
Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.
OpenLive – AI代理的本地语音与视觉层
是什么 – OpenLive 是一个桌面应用程序,可将任何 LLM 或编码代理(Claude、OpenAI、Gemini、Ollama 等)转变为在您自己电脑上完全运行的语音与视觉助手。它集成了:
- 语音活动检测(Silero VAD)
- 流式语音转文本(Whisper)
- 轮次切换逻辑(Smart-Turn)
- 文本转语音(Kokoro 或 Supertonic,支持可选的零样本语音克隆)
- 可选的摄像头/屏幕捕获,用于视觉增强模型。 所有音频处理均在 WebGPU 上本地完成;仅最终转录文本(以及可选的图像帧)通过正常 API 密钥发送至所选模型。
主要功能
- 模型无关 – 支持您拥有密钥的任何提供商(Anthropic、OpenAI、Google、xAI、DeepSeek、Groq、Ollama 等)。
- 代理无关 – 可驱动支持 Agent Client Protocol(Claude Code、Codex、Cursor、OpenCode、Hermes 等)的编码代理,作为子进程运行。
- 语音克隆 – 录制 5–30 秒自己的声音,本地生成克隆(ZipVoice),让助手以该声音说话。
- 打断(Barge-in) – 可随时中断助手;播放会在单词中间停止。
- 视觉支持 – 每轮可发送摄像头或屏幕帧;纯文本模型可调用独立的视觉模型。
- 浮动迷你模式 – 小型始终置顶窗口,带托盘图标,方便工作时快速访问。
- 隐私优先 – 无音频上传;API 密钥以加密方式存储(AES-256-GCM),仅显示最后四位数字。
- 会话持久化 – 对话以 Markdown 格式保存,可从 OpenLive UI 或代理 CLI 恢复,并包含成本/计划清单。
典型工作流程
- 安装应用(提供 macOS、Windows、Linux 二进制文件)。
- 在“设置 → 代理”中添加模型 API 密钥,或安装编码代理 CLI。
- (可选)录制一段短语音样本以克隆您的声音。
- 开始“通话”;应用监听语音,将语音转为文本,发送至所选模型,流式返回模型回复至 TTS 引擎,并在可选情况下显示摄像头/屏幕帧。
- 通过语音或点击回答代理的任何权限提示,并实时观察计划/成本 UI 更新。
快速上手
- 二进制文件 – 下载适用于您操作系统的最新版本,运行安装程序,粘贴模型密钥,点击 开始通话。
- 从源码构建 –
您也可以通过pnpm install pnpm desktop:dev # 启动 Electron + 本地服务器pnpm dev运行 Web UI(localhost:3000),并通过pnpm test运行测试。
架构概览
mic → VAD → 流式 STT → 轮次结束 → 您的 AI(通过 API 或 ACP) → 流式 TTS → 扬声器
↑
└─ 摄像头/屏幕帧(可选)
除外部模型外,所有组件均在 Electron 渲染器中使用 WebGPU 运行。轻量级 WebSocket 服务器负责轮次协调并驱动 ACP 兼容的编码代理。
仓库结构
apps/desktop– Electron 框架、托盘、迷你模式。apps/web– Next.js UI + 本地语音引擎。services/agent– WebSocket、ACP 驱动、语音克隆逻辑。packages/*– 共享类型、模型适配器、加密 JSON 存储。docs/ARCHITECTURE.md– 更深入的管道解析。
许可证 – MIT(可自由使用、修改和分发)。
OpenLive 是一个真正的开源项目,为 AI 代理提供了缺失的语音与视觉基础功能,让您无需支付持续音频费用,即可完全在本地与 LLM 或编码助手交互。
相关
- 项目
- 项目
- 项目
- 项目