Open-LLM-VTuber/Open-LLM-VTuber

Talk to any LLM with hands-free voice interaction, voice interruption, and Live2D taking face running locally across platforms

What it solves

Open-LLM-VTuber は、視覚的存在感を持つ音声インタラクティブ AI コンパニオンを作成します。ユーザーはカスタマイズ可能な Live2D アバターとリアルタイムかつマルチモーダルな会話ができ、ローカルマシン上で完全にオフラインで動作するため、クローズドソースの AI VTuber のプライベート代替手段を提供します。

How it works

このプロジェクトは、3 つの主要な AI コンポーネントを統合したシステムです:インテリジェンスを担う Large Language Model(LLM)、聴覚を担う Automatic Speech Recognition(ASR)、発話を担う Text-to-Speech(TTS)。これらは Live2D アバターにリンクされ、表情や動きで反応します。Ollama、OpenAI、ローカル GGUF モデルなど様々なバックエンドをサポートし、Web インターフェースと「ペットモード」付きデスクトップクライアント(透明で常に最前面のオーバーレイ)を提供します。

Who it’s for

パーソナライズされた AI コンパニオン(バーチャルパートナーやペットなど)を求めるユーザー、VTuber 愛好者、視覚・聴覚フィードバックを備えたインタラクティブ AI エージェントを構築したい開発者向けです。

Highlights

  • Multimodal Interaction:カメラ、画面録画、スクリーンショットによる視覚認識と、クリックやドラッグによるタッチフィードバックをサポート。
  • Privacy-First:ローカルモデルを使用して完全にオフラインで実行可能。
  • Live2D Integration:感情マッピングでアバター表情を制御し、透明な「デスクトップペット」モードを提供。
  • Broad Compatibility:Windows、macOS、Linux をサポートし、幅広い LLM、ASR、TTS プロバイダーと統合。
  • Advanced Audio:音声割り込み処理(AI が自分の声を聞かないように)と TTS 翻訳サポートを含む。