anliyuan/Ultralight-Digital-Human

一个超轻量级、可以在移动端实时运行的数字人模型

解决的问题

该项目提供了一个轻量级的数字人模型,能够在移动设备上实现实时运行。它能够从特定人物的短视频(3-5分钟)中创建个性化的说话头像,并与提供的音频轨道同步口型动作。

工作原理

该系统采用个性化训练方法,为每个人训练专用模型。使用 HuBERT(用于更高品质)或 Wenet(用于更快、移动端就绪的推理)等编码器处理音频。随后,基于 UNet 的架构将这些音频特征映射为视觉面部动作。项目支持流式推理以降低延迟,并支持 ONNX 导出,以优化移动硬件上的性能。

适用人群

  • 开发移动应用实时 AI 头像的开发者。
  • 希望用最少训练数据创建个性化数字分身的用户。
  • 对轻量级、本地化说话头生成感兴趣的科研人员。

主要亮点

  • 移动端实时性能:专为在移动设备上高效运行而设计。
  • 灵活的音频编码器:支持 HuBERT(注重质量)和 Wenet(注重速度)。
  • 流式支持:包含流式推理逻辑,实现低延迟播放。
  • 个性化训练:提供简单流程,仅需几分钟视频即可训练自定义模型。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目