lipku/LiveTalking
Real time interactive streaming digital human
解決的問題
LiveTalking 是一個面向數位人類的即時互動式串流引擎。它解決了建立逼真、音視頻同步對話系統的問題,讓虛擬化身能根據文字或語音輸入,以真實的口型同步方式回應,進而在直播、客戶服務與教育領域實現無縫互動。
工作原理
系統遵循以下流程:使用者輸入(文字/音訊)→ LLM(對話生成)→ TTS(語音合成)→ 數位人類模型(口型同步)→ 串流輸出。
採用模組化架構:
- API 層:管理會話,並透過
/human與/humanaudio端點處理請求。 - 邏輯層:整合 LLM(如 Qwen)與多種 TTS 引擎(EdgeTTS、GPT-SoVITS、CosyVoice)以產生語音。
- 渲染層:使用 Wav2Lip、MuseTalk、ER-NeRF 等深度學習模型,根據音訊特徵生成口型同步畫面。
- 串流層:透過 WebRTC(低延遲)、RTMP(廣播用)或虛擬相機方式輸出影片串流。
適用對象
本專案專為希望導入 AI 虛擬人應用的開發者與企業設計,適用於:
- 虛擬主播:使用自動化腳本實現 24/7 無人直播。
- AI 客戶服務:與企業知識庫進行即時語音互動。
- 線上教育:建立數位教師克隆,用於即時或錄播課程。
- 智慧語音助理:將數位人類整合至應用程式或智慧音箱中。
- 內容創作者:無需實體拍攝即可批量製作短影片。
核心亮點
- 多模型支援:相容 ernerf、musetalk、wav2lip 與 Ultralight-Digital-Human。
- 低延遲:支援 WebRTC,實現瀏覽器端即時互動。
- 語音克隆:整合語音克隆功能,可個人化虛擬人聲音。
- 可中斷對話:允許使用者在虛擬人說話時中斷。
- 彈性輸出:支援 WebRTC、RTMP 與虛擬相機輸出。
- 動作編排:當虛擬人不說話時,可播放自訂影片。
- 自訂虛擬人:支援建立與客製化數位人類影像。
相關
- 專案
- 專案
- 專案
- 專案
- 專案