TaoLiveAIGC/TaoMate

a real-time digital-human model for long-form audio-video generation

TaoMate – 실시간 음성·영상 디지털 인간 생성

무엇인가요 – TaoMate는 실시간으로 대화하는 디지털 인간(아바타)을 생성할 수 있는 연구용 시스템으로, 텍스트 프롬프트 시퀀스에서 고해상도 영상과 음성을 동기화하여 생성합니다. 리포지토리는 추론 런타임, 멀티 GPU 실행 스크립트, 그리고 지속 모델 워커를 실행하는 인터랙티브 브라우저 데모를 포함합니다.

주요 구성 요소

  • 생성기 – LTX-2.3 22B 트랜스포머(BF16) 기반으로, 최대 12개의 프롬프트 세그먼트(약 1분 출력)에 걸쳐 장기적 맥락을 유지하는 고유한 앵커 유도 메모리 브리지를 탑재했습니다.
  • 텍스트 인코더 – Gemma-3 12B IT 모델로, 프롬프트 텍스트를 임베딩합니다.
  • 대화 및 계획 – 인터랙티브 데모에서 실시간 대화 및 프롬프트 계획을 위해 선택적 Gemma-4 26B A4B GGUF 모델을 사용합니다.
  • 음성 – 데모에서 음성 인식(ASR)에 OpenAI Whisper-tiny를 사용하며, 생성기는 자체적으로 오디오 트랙을 생성합니다.
  • 분산 추론 – 단일 GPU 또는 2GPU 실행 스크립트로 모델을 장치 간에 분할합니다. 전체 데모는 4GPU(생성, 텍스트 조건부, 복호화, 대화)를 사용합니다.

하드웨어 요구 사항

  • Linux x86_64, Python 3.10
  • CUDA 12.8 지원 NVIDIA GPU; 참조 512×768, 1분 배치용으로 72GB VRAM 필요 (단일 GPU 피크 ≈ 66.8 GiB, 2GPU ≈ 각 33.6 GiB)
  • ffmpeg, tmux, curl

설치 (요약)

# 시스템 종속성
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv

# 리포지토리 설정
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
    --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt

CUDA 확인은 python -c "import torch; print(torch.__version__, torch.cuda.device_count())"로 수행합니다.

모델 가중치 – 리포지토리에 저장되지 않습니다. Hugging Face에서 세 가지 체크포인트를 다운로드해야 합니다:

  1. TaoMate (model.pt) – 최적화된 생성기.
  2. LTX-2.3 (ltx-2.3-22b-dev.safetensors) – 기본 트랜스포머.
  3. Gemma-3 12B IT (전체 디렉터리) – 텍스트 인코더. hf download 명령어를 사용하고, 환경 변수 MODEL_CKPT, BASE_MODEL_CKPT, GEMMA_PATH를 절대 경로로 설정하세요.

추론 실행

  • 배치 모드 – 제공된 쉘 스크립트 run_taomate_1gpu.sh 또는 run_taomate_2gpu.sh를 사용합니다. JSON 리스트 형식으로 케이스(각 케이스 = 최대 12개의 프롬프트/시드 쌍)를 제공합니다. 입력 형식 예시는 README에 나와 있습니다.
  • 출력 – 생성된 영상은 OUTPUT_DIR로 지정한 디렉터리에 <case_id>.mp4 형식으로 저장됩니다.

인터랙티브 데모

  1. 추가 대화 모델(Gemma-4 26B GGUF)을 설치하고, ggml-org/llama.cpp에서 CUDA 지원 llama-server를 빌드합니다.
  2. Whisper-tiny를 로컬에 다운로드합니다.
  3. scripts/inference/start_interactive_avatar_stack.sh로 전체 스택을 시작합니다. 이 스크립트는 다음을 시작합니다:
    • 대화 서버 (Gemma-4)
    • 지속 TaoMate 워커 (GPU 0-1)
    • 복호화/ASR 워커 (GPU 2)
    • 웹 서비스 (GPU 3)
  4. http://127.0.0.1:7860/을 열어 브라우저에서 아바타와 상호작용합니다.
  5. scripts/inference/stop_interactive_avatar_stack.sh로 모든 것을 중지합니다.

리포지토리 구조

apps/interactive_avatar/   # 데모 UI 및 워커 코드
configs/inference/         # 예제 프롬프트 JSON 파일
ltx_*/*                    # 핵심 트랜스포머, 캐시, 디코더 코드
scripts/inference/         # 배치 및 데모용 실행 스크립트
taomate/inference/         # 고수준 추론 래퍼

라이선스 – 코드는 Apache 2.0. 모델 가중치는 원본 라이선스(예: LTX-2.3, Gemma, Whisper 등)를 유지합니다.

누가 사용할까 – 실시간 디지털 인간 생성을 연구하는 연구자, 아바타 기반 채팅 또는 스트리밍 서비스를 개발하는 개발자, 고사양 GPU에서 장시간 동기화 음성·영상 생성의 참조 구현이 필요한 누구나.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트