TaoLiveAIGC/TaoMate
a real-time digital-human model for long-form audio-video generation
TaoMate – 실시간 음성·영상 디지털 인간 생성
무엇인가요 – TaoMate는 실시간으로 대화하는 디지털 인간(아바타)을 생성할 수 있는 연구용 시스템으로, 텍스트 프롬프트 시퀀스에서 고해상도 영상과 음성을 동기화하여 생성합니다. 리포지토리는 추론 런타임, 멀티 GPU 실행 스크립트, 그리고 지속 모델 워커를 실행하는 인터랙티브 브라우저 데모를 포함합니다.
주요 구성 요소
- 생성기 – LTX-2.3 22B 트랜스포머(BF16) 기반으로, 최대 12개의 프롬프트 세그먼트(약 1분 출력)에 걸쳐 장기적 맥락을 유지하는 고유한 앵커 유도 메모리 브리지를 탑재했습니다.
- 텍스트 인코더 – Gemma-3 12B IT 모델로, 프롬프트 텍스트를 임베딩합니다.
- 대화 및 계획 – 인터랙티브 데모에서 실시간 대화 및 프롬프트 계획을 위해 선택적 Gemma-4 26B A4B GGUF 모델을 사용합니다.
- 음성 – 데모에서 음성 인식(ASR)에 OpenAI Whisper-tiny를 사용하며, 생성기는 자체적으로 오디오 트랙을 생성합니다.
- 분산 추론 – 단일 GPU 또는 2GPU 실행 스크립트로 모델을 장치 간에 분할합니다. 전체 데모는 4GPU(생성, 텍스트 조건부, 복호화, 대화)를 사용합니다.
하드웨어 요구 사항
- Linux x86_64, Python 3.10
- CUDA 12.8 지원 NVIDIA GPU; 참조 512×768, 1분 배치용으로 72GB VRAM 필요 (단일 GPU 피크 ≈ 66.8 GiB, 2GPU ≈ 각 33.6 GiB)
ffmpeg,tmux,curl
설치 (요약)
# 시스템 종속성
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv
# 리포지토리 설정
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
--index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
CUDA 확인은 python -c "import torch; print(torch.__version__, torch.cuda.device_count())"로 수행합니다.
모델 가중치 – 리포지토리에 저장되지 않습니다. Hugging Face에서 세 가지 체크포인트를 다운로드해야 합니다:
- TaoMate (
model.pt) – 최적화된 생성기. - LTX-2.3 (
ltx-2.3-22b-dev.safetensors) – 기본 트랜스포머. - Gemma-3 12B IT (전체 디렉터리) – 텍스트 인코더.
hf download명령어를 사용하고, 환경 변수MODEL_CKPT,BASE_MODEL_CKPT,GEMMA_PATH를 절대 경로로 설정하세요.
추론 실행
- 배치 모드 – 제공된 쉘 스크립트
run_taomate_1gpu.sh또는run_taomate_2gpu.sh를 사용합니다. JSON 리스트 형식으로 케이스(각 케이스 = 최대 12개의 프롬프트/시드 쌍)를 제공합니다. 입력 형식 예시는 README에 나와 있습니다. - 출력 – 생성된 영상은
OUTPUT_DIR로 지정한 디렉터리에<case_id>.mp4형식으로 저장됩니다.
인터랙티브 데모
- 추가 대화 모델(Gemma-4 26B GGUF)을 설치하고,
ggml-org/llama.cpp에서 CUDA 지원llama-server를 빌드합니다. - Whisper-tiny를 로컬에 다운로드합니다.
scripts/inference/start_interactive_avatar_stack.sh로 전체 스택을 시작합니다. 이 스크립트는 다음을 시작합니다:- 대화 서버 (Gemma-4)
- 지속 TaoMate 워커 (GPU 0-1)
- 복호화/ASR 워커 (GPU 2)
- 웹 서비스 (GPU 3)
http://127.0.0.1:7860/을 열어 브라우저에서 아바타와 상호작용합니다.scripts/inference/stop_interactive_avatar_stack.sh로 모든 것을 중지합니다.
리포지토리 구조
apps/interactive_avatar/ # 데모 UI 및 워커 코드
configs/inference/ # 예제 프롬프트 JSON 파일
ltx_*/* # 핵심 트랜스포머, 캐시, 디코더 코드
scripts/inference/ # 배치 및 데모용 실행 스크립트
taomate/inference/ # 고수준 추론 래퍼
라이선스 – 코드는 Apache 2.0. 모델 가중치는 원본 라이선스(예: LTX-2.3, Gemma, Whisper 등)를 유지합니다.
누가 사용할까 – 실시간 디지털 인간 생성을 연구하는 연구자, 아바타 기반 채팅 또는 스트리밍 서비스를 개발하는 개발자, 고사양 GPU에서 장시간 동기화 음성·영상 생성의 참조 구현이 필요한 누구나.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트