lipku/LiveTalking

Real time interactive streaming digital human

解決的問題

LiveTalking 是一個面向數位人類的即時互動式串流引擎。它解決了建立逼真、音視頻同步對話系統的問題,讓虛擬化身能根據文字或語音輸入,以真實的口型同步方式回應,進而在直播、客戶服務與教育領域實現無縫互動。

工作原理

系統遵循以下流程:使用者輸入(文字/音訊)→ LLM(對話生成)→ TTS(語音合成)→ 數位人類模型(口型同步)→ 串流輸出。

採用模組化架構:

  • API 層:管理會話,並透過 /human/humanaudio 端點處理請求。
  • 邏輯層:整合 LLM(如 Qwen)與多種 TTS 引擎(EdgeTTS、GPT-SoVITS、CosyVoice)以產生語音。
  • 渲染層:使用 Wav2Lip、MuseTalk、ER-NeRF 等深度學習模型,根據音訊特徵生成口型同步畫面。
  • 串流層:透過 WebRTC(低延遲)、RTMP(廣播用)或虛擬相機方式輸出影片串流。

適用對象

本專案專為希望導入 AI 虛擬人應用的開發者與企業設計,適用於:

  • 虛擬主播:使用自動化腳本實現 24/7 無人直播。
  • AI 客戶服務:與企業知識庫進行即時語音互動。
  • 線上教育:建立數位教師克隆,用於即時或錄播課程。
  • 智慧語音助理:將數位人類整合至應用程式或智慧音箱中。
  • 內容創作者:無需實體拍攝即可批量製作短影片。

核心亮點

  • 多模型支援:相容 ernerf、musetalk、wav2lip 與 Ultralight-Digital-Human。
  • 低延遲:支援 WebRTC,實現瀏覽器端即時互動。
  • 語音克隆:整合語音克隆功能,可個人化虛擬人聲音。
  • 可中斷對話:允許使用者在虛擬人說話時中斷。
  • 彈性輸出:支援 WebRTC、RTMP 與虛擬相機輸出。
  • 動作編排:當虛擬人不說話時,可播放自訂影片。
  • 自訂虛擬人:支援建立與客製化數位人類影像。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案