Open-LLM-VTuber/Open-LLM-VTuber
Talk to any LLM with hands-free voice interaction, voice interruption, and Live2D taking face running locally across platforms
What it solves
Open-LLM-VTuber は、視覚的存在感を持つ音声インタラクティブ AI コンパニオンを作成します。ユーザーはカスタマイズ可能な Live2D アバターとリアルタイムかつマルチモーダルな会話ができ、ローカルマシン上で完全にオフラインで動作するため、クローズドソースの AI VTuber のプライベート代替手段を提供します。
How it works
このプロジェクトは、3 つの主要な AI コンポーネントを統合したシステムです:インテリジェンスを担う Large Language Model(LLM)、聴覚を担う Automatic Speech Recognition(ASR)、発話を担う Text-to-Speech(TTS)。これらは Live2D アバターにリンクされ、表情や動きで反応します。Ollama、OpenAI、ローカル GGUF モデルなど様々なバックエンドをサポートし、Web インターフェースと「ペットモード」付きデスクトップクライアント(透明で常に最前面のオーバーレイ)を提供します。
Who it’s for
パーソナライズされた AI コンパニオン(バーチャルパートナーやペットなど)を求めるユーザー、VTuber 愛好者、視覚・聴覚フィードバックを備えたインタラクティブ AI エージェントを構築したい開発者向けです。
Highlights
- Multimodal Interaction:カメラ、画面録画、スクリーンショットによる視覚認識と、クリックやドラッグによるタッチフィードバックをサポート。
- Privacy-First:ローカルモデルを使用して完全にオフラインで実行可能。
- Live2D Integration:感情マッピングでアバター表情を制御し、透明な「デスクトップペット」モードを提供。
- Broad Compatibility:Windows、macOS、Linux をサポートし、幅広い LLM、ASR、TTS プロバイダーと統合。
- Advanced Audio:音声割り込み処理(AI が自分の声を聞かないように)と TTS 翻訳サポートを含む。