lipku/LiveTalking

Real time interactive streaming digital human

解决的问题

LiveTalking 是一个面向数字人的实时交互式流媒体引擎。它解决了创建逼真、音视频同步对话系统的问题,使虚拟化身能够根据文本或语音输入进行真实口型同步的回应,从而在直播、客户服务和教育领域实现无缝互动。

工作原理

该系统遵循以下流程:用户输入(文本/音频)→ LLM(对话生成)→ TTS(文本转语音)→ 数字人模型(口型同步)→ 流媒体输出。

采用模块化架构:

  • API 层:管理会话,并通过 /human/humanaudio 端点处理请求。
  • 逻辑层:集成 LLM(如 Qwen)和多种 TTS 引擎(EdgeTTS、GPT-SoVITS、CosyVoice)以生成语音。
  • 渲染层:使用 Wav2Lip、MuseTalk、ER-NeRF 等深度学习模型,基于音频特征生成口型同步帧。
  • 流媒体层:通过 WebRTC(低延迟)、RTMP(广播)或虚拟摄像头方式输出视频流。

适用对象

本项目专为希望实现 AI 虚拟人应用的开发者和企业设计,适用于:

  • 虚拟主播:使用自动化脚本实现 24/7 无人直播。
  • AI 客户服务:与企业知识库进行实时语音交互。
  • 在线教育:创建数字教师克隆,用于实时或录播课程。
  • 智能语音助手:将数字人集成到应用或智能音箱中。
  • 内容创作者:无需实体拍摄即可批量制作短视频。

核心亮点

  • 多模型支持:兼容 ernerf、musetalk、wav2lip 和 Ultralight-Digital-Human。
  • 低延迟:支持 WebRTC,实现浏览器端实时交互。
  • 语音克隆:集成语音克隆功能,可个性化虚拟人声音。
  • 可中断对话:允许用户在虚拟人说话过程中打断。
  • 灵活输出:支持 WebRTC、RTMP 和虚拟摄像头输出。
  • 动作编排:当虚拟人不说话时,可播放自定义视频。
  • 自定义虚拟人:支持创建和定制数字人图像。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目