datascale-ai/opentalking

OpenTalking: An industrial-grade open-source AI digital human framework that supports real-time conversation, private deployment, and pluggable models.

解决的问题

OpenTalking 提供一个完整的开源编排框架,用于创建实时数字人对话。它消除了手动拼接语音转文本(STT)、大语言模型(LLM)、文本转语音(TTS)和视频渲染的复杂性,从而实现可交互的说话虚拟形象。

工作原理

该项目作为一个生产级堆栈,管理整个对话流程:前端交互、会话状态、LLM 响应、语音选择、中断控制以及 WebRTC 音视频播放。它支持多种部署路径,从轻量级的「模拟」模式(用于 API 验证)到使用 OmniRT 的高质量远程推理。它集成了多种数字人驱动模型(如 QuickTalk、Wav2Lip 和 FlashTalk),根据音频或文本输入来驱动虚拟形象的动画。

适用人群

专为开发者和创作者设计,适用于医疗指导、直播电商、虚拟伴侣、新闻主播等场景,也适合希望探索音视频驱动创作和视频克隆的用户。

主要亮点

  • 可插拔后端:支持广泛的 LLM、STT 和 TTS 提供商,包括 OpenAI 兼容接口。
  • 灵活部署:提供 CPU 专用测试、消费级 GPU 本地部署(RTX 3090/4090)以及高质量远程 GPU/NPU 集群的路径。
  • 全面的工具集:包含用于管理虚拟形象、语音和模型配置的 WebUI,还支持知识库和角色记忆功能。
  • 多样化的渲染模型:集成多种驱动模型,如注重速度的 QuickTalk、注重可访问性的 Wav2Lip,以及适用于视频克隆和高质量创作的 FasterLivePortrait。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目