anliyuan/Ultralight-Digital-Human
一个超轻量级、可以在移动端实时运行的数字人模型
解决的问题
该项目提供了一个轻量级的数字人模型,能够在移动设备上实现实时运行。它能够从特定人物的短视频(3-5分钟)中创建个性化的说话头像,并与提供的音频轨道同步口型动作。
工作原理
该系统采用个性化训练方法,为每个人训练专用模型。使用 HuBERT(用于更高品质)或 Wenet(用于更快、移动端就绪的推理)等编码器处理音频。随后,基于 UNet 的架构将这些音频特征映射为视觉面部动作。项目支持流式推理以降低延迟,并支持 ONNX 导出,以优化移动硬件上的性能。
适用人群
- 开发移动应用实时 AI 头像的开发者。
- 希望用最少训练数据创建个性化数字分身的用户。
- 对轻量级、本地化说话头生成感兴趣的科研人员。
主要亮点
- 移动端实时性能:专为在移动设备上高效运行而设计。
- 灵活的音频编码器:支持 HuBERT(注重质量)和 Wenet(注重速度)。
- 流式支持:包含流式推理逻辑,实现低延迟播放。
- 个性化训练:提供简单流程,仅需几分钟视频即可训练自定义模型。
相关
- 项目
- 项目
- 项目
- 项目
- 项目