lipku/LiveTalking
Real time interactive streaming digital human
何を解決するか
LiveTalking は、デジタル人間向けのリアルタイムインタラクティブストリーミングエンジンです。仮想アバターがテキストまたは音声入力に応じてリアルな口パクを伴って発話できる、生々しく同期された音声・映像対話システムを構築する課題を解決します。これにより、ライブストリーミング、カスタマーサービス、教育分野でのシームレスな相互作用が可能になります。
動作方法
システムは以下のパイプラインに従います:ユーザー入力(テキスト/音声)→ LLM(会話生成)→ TTS(音声合成)→ デジタル人間モデル(口パク同期)→ ストリーミング出力。
モジュールアーキテクチャを採用しています:
- APIレイヤー:セッションを管理し、
/humanおよび/humanaudioエンドポイントを通じてリクエストを処理。 - ロジックレイヤー:Qwen などの LLM と、EdgeTTS、GPT-SoVITS、CosyVoice などのさまざまな TTS エンジンを統合して音声を生成。
- レンダリングレイヤー:Wav2Lip、MuseTalk、ER-NeRF などの深層学習モデルを使用して、音声特徴に基づいた口パクフレームを生成。
- ストリーミングレイヤー:WebRTC(低遅延)、RTMP(放送用)、または仮想カメラとしてビデオストリームを配信。
対象ユーザー
このプロジェクトは、以下の用途にAIアバターを導入したい開発者や企業向けに設計されています:
- 仮想ストリーマー:自動スクリプトによる24時間365日無人ライブストリーミング。
- AIカスタマーサービス:企業の知識ベースとリアルタイム音声対話。
- オンライン教育:リアルタイムまたは録画された授業用のデジタル教師クローンの作成。
- スマート音声アシスタント:アプリやスマートスピーカーにデジタル人間を統合。
- コンテンツクリエイター:実写撮影なしで短編動画を一括生成。
特徴
- マルチモデル対応:ernerf、musetalk、wav2lip、Ultralight-Digital-Human と互換性あり。
- 低遅延:リアルタイムブラウザベースの相互作用に対応する WebRTC をサポート。
- ボイスクラーニング:アバターの声をカスタマイズ可能なボイスクラーニング機能を統合。
- 中断可能な会話:アバターが発話中でもユーザーが中断可能。
- 柔軟な出力:WebRTC、RTMP、仮想カメラ出力に対応。
- アクションオーケストレーション:アバターが発話していない際にはカスタム動画を再生可能。
- カスタムアバター:独自のデジタル人間画像の作成・カスタマイズをサポート。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト