lipku/LiveTalking
Real time interactive streaming digital human
解决的问题
LiveTalking 是一个面向数字人的实时交互式流媒体引擎。它解决了创建逼真、音视频同步对话系统的问题,使虚拟化身能够根据文本或语音输入进行真实口型同步的回应,从而在直播、客户服务和教育领域实现无缝互动。
工作原理
该系统遵循以下流程:用户输入(文本/音频)→ LLM(对话生成)→ TTS(文本转语音)→ 数字人模型(口型同步)→ 流媒体输出。
采用模块化架构:
- API 层:管理会话,并通过
/human和/humanaudio端点处理请求。 - 逻辑层:集成 LLM(如 Qwen)和多种 TTS 引擎(EdgeTTS、GPT-SoVITS、CosyVoice)以生成语音。
- 渲染层:使用 Wav2Lip、MuseTalk、ER-NeRF 等深度学习模型,基于音频特征生成口型同步帧。
- 流媒体层:通过 WebRTC(低延迟)、RTMP(广播)或虚拟摄像头方式输出视频流。
适用对象
本项目专为希望实现 AI 虚拟人应用的开发者和企业设计,适用于:
- 虚拟主播:使用自动化脚本实现 24/7 无人直播。
- AI 客户服务:与企业知识库进行实时语音交互。
- 在线教育:创建数字教师克隆,用于实时或录播课程。
- 智能语音助手:将数字人集成到应用或智能音箱中。
- 内容创作者:无需实体拍摄即可批量制作短视频。
核心亮点
- 多模型支持:兼容 ernerf、musetalk、wav2lip 和 Ultralight-Digital-Human。
- 低延迟:支持 WebRTC,实现浏览器端实时交互。
- 语音克隆:集成语音克隆功能,可个性化虚拟人声音。
- 可中断对话:允许用户在虚拟人说话过程中打断。
- 灵活输出:支持 WebRTC、RTMP 和虚拟摄像头输出。
- 动作编排:当虚拟人不说话时,可播放自定义视频。
- 自定义虚拟人:支持创建和定制数字人图像。
相关
- 项目
- 项目
- 项目
- 项目
- 项目