anliyuan/Ultralight-Digital-Human
一个超轻量级、可以在移动端实时运行的数字人模型
해결하는 문제
이 프로젝트는 모바일 기기에서 실시간으로 작동할 수 있는 가벼운 디지털 인간 모델을 제공합니다. 특정 사람의 짧은 영상(3~5분)을 기반으로, 제공된 오디오 트랙에 맞춰 입모양을 동기화하는 개인화된 토크헤드 아바타를 생성할 수 있습니다.
작동 방식
이 시스템은 각 개인별로 전용 모델을 훈련하는 개인화된 훈련 방식을 사용합니다. 음성은 HuBERT(더 높은 품질을 위해) 또는 Wenet(더 빠르고 모바일 대응 가능한 추론을 위해)와 같은 인코더를 사용하여 처리됩니다. 이후 UNet 기반 아키텍처가 이러한 음성 특징을 시각적인 얼굴 움직임으로 매핑합니다. 프로젝트는 지연을 줄이기 위해 스트리밍 추론을 지원하며, ONNX 내보내기를 통해 모바일 하드웨어에서 성능을 최적화할 수 있습니다.
대상 사용자
- 모바일 애플리케이션용 실시간 AI 아바타를 개발하는 개발자.
- 최소한의 훈련 데이터로 개인화된 디지털 듀플리케이션을 만들고 싶은 사용자.
- 가벼운 온디바이스 토크헤드 생성에 관심 있는 연구자.
주요 특징
- 모바일 실시간 성능: 모바일 기기에서 효율적으로 작동하도록 특별히 설계되었습니다.
- 유연한 오디오 인코더: 품질을 우선하는 HuBERT와 속도를 우선하는 Wenet 모두 지원합니다.
- 스트리밍 지원: 낮은 지연 재생을 달성하기 위한 스트리밍 추론 로직을 포함합니다.
- 개인화된 훈련: 몇 분 분량의 영상 데이터로 사용자 맞춤형 모델을 간단한 파이프라인으로 훈련할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트