anliyuan/Ultralight-Digital-Human
一个超轻量级、可以在移动端实时运行的数字人模型
解決的問題
本專案提供一個輕量級的數位人模型,可在行動裝置上實時運作。它能從特定人物的短影片(3-5分鐘)中,創建個人化的說話頭像,並與提供的音訊軌道同步口型動作。
工作原理
系統採用個人化訓練方法,為每位個人訓練專用模型。使用 HuBERT(用於更高品質)或 Wenet(用於更快、行動裝置就緒的推論)等編碼器處理音訊。隨後,基於 UNet 的架構將這些音訊特徵轉換為視覺面部動作。專案支援串流推論以降低延遲,並支援 ONNX 匯出,以優化行動硬體上的效能。
適用對象
- 開發行動應用實時 AI 头像的開發者。
- 希望以最少訓練資料創建個人化數位分身的使用者。
- 對輕量級、本地化說話頭生成感興趣的研究人員。
主要亮點
- 行動端即時效能:專為在行動裝置上高效運作而設計。
- 彈性音訊編碼器:支援 HuBERT(注重品質)與 Wenet(注重速度)。
- 串流支援:包含串流推論邏輯,實現低延遲播放。
- 個人化訓練:提供簡單流程,僅需數分鐘影片即可訓練自訂模型。
相關
- 專案
- 專案
- 專案
- 專案
- 專案