katipally/openlive

Opensource, on-device voice + vision layer for AI agents. Bring any model or coding agent; the whole speech loop (VAD, STT, TTS, barge-in) runs locally. An open alternative to ElevenLabs Agents, Gemini Live, and OpenAI Realtime.

OpenLive – AIエージェント用のデスクトップ音声・視覚レイヤー

何であるか – OpenLiveは、任意のLLMまたはコーディングエージェント(Claude、OpenAI、Gemini、Ollamaなど)を、あなたのコンピュータ上で完全に動作する音声・視覚アシスタントに変えるデスクトップアプリです。以下の要素を統合しています:

  • 音声活動検出(Silero VAD)
  • ストリーミング音声認識(Whisper)
  • ターン切り替えロジック(Smart-Turn)
  • テキストから音声(KokoroまたはSupertonic、オプションでゼロショット音声クローン)
  • カメラ/スクリーンキャプチャ(視覚対応モデル用にオプション) すべての音声処理はWebGPU上でローカルで実行され、最終的なトランスクリプト(および任意の画像フレーム)のみが、通常のAPIキー経由で選択したモデルに送信されます。

主な機能

  • モデル非依存 – 任意のAPIキーを持つプロバイダー(Anthropic、OpenAI、Google、xAI、DeepSeek、Groq、Ollamaなど)に対応。
  • エージェント非依存 – Agent Client Protocol(Claude Code、Codex、Cursor、OpenCode、Hermesなど)をサポートするコーディングエージェントを子プロセスとして制御可能。
  • 音声クローン – 自分の声を5〜30秒録音し、ローカルでクローン(ZipVoice)を生成し、アシスタントがその声で話すように設定可能。
  • バージイン – いつでもアシスタントを中断可能。再生は単語途中で停止。
  • 視覚対応 – 各ターンでカメラまたはスクリーンのフレームを送信。テキストのみのモデルは別途視覚モデルを呼び出せる。
  • 浮動ミニモード – 作業中にすぐアクセスできる、常に手前に表示される小さなウィンドウとトレイアイコン。
  • プライバシー最優先 – 音声はアップロードされない。APIキーは暗号化(AES-256-GCM)で保存され、表示されるのは最後の4桁のみ。
  • セッションの永続化 – 会話はMarkdown形式で保存され、OpenLive UIまたはエージェントのCLIから再開可能。コスト/プランのチェックリストも含まれる。

通常のワークフロー

  1. アプリをインストール(macOS、Windows、Linuxのバイナリが提供)。
  2. 設定 → エージェントからモデルのAPIキーを追加、またはコーディングエージェントのCLIをインストール。
  3. (オプション)自分の声をクローンするための短い音声サンプルを録音。
  4. 「通話」を開始。アプリが音声をリッスンし、音声をテキストに変換し、選択したAIにターンを送信。AIの返答をストリーミングでTTSエンジンに送信し、音声で読み上げながら、必要に応じてカメラ/スクリーンのフレームを表示。
  5. エージェントからの権限プロンプトに音声またはタップで応答し、プラン/コストUIがリアルタイムで更新されるのを確認。

導入方法

  • バイナリ – お使いのOS向け最新リリースをダウンロードし、インストーラーを実行。モデルキーを貼り付け、通話開始をクリック。
  • ソースから
    pnpm install
    pnpm desktop:dev   # Electron + ローカルサーバーを起動
    
    また、pnpm devでWeb UI(localhost:3000)を実行可能。テストはpnpm testで実行可能。

アーキテクチャの概要

mic → VAD → ストリーミングSTT → ターン終了 → あなたのAI(APIまたはACP経由) → ストリーミングTTS → スピーカー
                ↑
                └─ カメラ/スクリーンフレーム(オプション)

外部モデル以外のすべてのコンポーネントは、WebGPUを使用したElectronレンダラーで実行されます。軽量なWebSocketサーバーがターンを仲介し、ACP互換のコーディングエージェントを制御します。

リポジトリ構成

  • apps/desktop – Electronシェル、トレイ、ミニモード。
  • apps/web – Next.js UI + ローカル音声エンジン。
  • services/agent – WebSocket、ACPドライバー、音声クローンロジック。
  • packages/* – 共有型、モデルアダプター、暗号化JSONストア。
  • docs/ARCHITECTURE.md – パイプラインの詳細な解説。

ライセンス – MIT(自由に使用・変更・再配布可能)。


OpenLiveは本物のオープンソースプロジェクトであり、AIエージェントに必要な音声と視覚の基盤を提供し、継続的な音声料金なしに、完全にローカルでLLMやコーディングアシスタントとやり取りできるようにします。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト