TaoLiveAIGC/TaoMate

a real-time digital-human model for long-form audio-video generation

TaoMate – 実時間音声・映像デジタル人間生成

何であるか – TaoMate は、リアルタイムで会話するデジタル人間(アバター)を合成できる研究用システムであり、テキストプロンプトのシーケンスから高解像度の映像と音声を同期して生成します。リポジトリには推論ランタイム、マルチGPU起動スクリプト、および常駐モデルワーカーを実行するインタラクティブブラウザーデモが含まれています。

主要なコンポーネント

  • ジェネレータ – LTX-2.3 22Bトランスフォーマー(BF16)に基づき、カスタムの アンカー誘導メモリブリッジ を搭載。最大12セグメントのプロンプト(約1分間の出力)にわたって長期間のコンテキストを保持します。
  • テキストエンコーダ – Gemma-3 12B ITモデル。プロンプトテキストを埋め込みます。
  • 会話と計画 – インタラクティブデモでリアルタイムの会話とプロンプト計画に使用するオプションの Gemma-4 26B A4B GGUFモデル。
  • 音声 – デモでの音声認識(ASR)に OpenAI Whisper-tiny を使用。ジェネレータ自体が音声トラックを生成します。
  • 分散推論 – シングルGPUまたは2GPU起動スクリプトでモデルをデバイス間で分割。フルデモでは4GPU(生成、テキスト条件付け、デコード、会話)を使用します。

ハードウェア要件

  • Linux x86_64、Python 3.10
  • CUDA 12.8 対応 NVIDIA GPU;リファレンスの 512×768、1分間バッチ用に 72GB VRAMが必要(シングルGPUピーク ≈ 66.8 GiB、2GPU ≈ 各33.6 GiB)
  • ffmpegtmuxcurl

インストール(概要)

# システム依存関係
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv

# リポジトリ設定
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
    --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt

CUDAの確認は python -c "import torch; print(torch.__version__, torch.cuda.device_count())" で行います。

モデル重み – リポジトリ内には格納されていません。Hugging Faceから3つのチェックポイントをダウンロードする必要があります:

  1. TaoMate (model.pt) – ファインチューニングされたジェネレータ。
  2. LTX-2.3 (ltx-2.3-22b-dev.safetensors) – 基底トランスフォーマー。
  3. Gemma-3 12B IT(フルディレクトリ) – テキストエンコーダ。 hf download コマンドを使用し、環境変数 MODEL_CKPTBASE_MODEL_CKPTGEMMA_PATH を絶対パスに設定してください。

推論の実行

  • バッチモード – 提供されたシェルスクリプト run_taomate_1gpu.sh または run_taomate_2gpu.sh を使用。JSONリスト形式でケース(各ケース = 最大12のプロンプト/シードペア)を指定。入力フォーマットの例はREADMEに記載されています。
  • 出力 – 生成された動画は、OUTPUT_DIR で指定したディレクトリに <case_id>.mp4 として保存されます。

インタラクティブデモ

  1. オプションの会話モデル(Gemma-4 26B GGUF)をインストールし、ggml-org/llama.cpp からCUDA対応の llama-server をビルド。
  2. Whisper-tiny をローカルにダウンロード。
  3. scripts/inference/start_interactive_avatar_stack.sh でフルスタックを起動。このスクリプトは以下のコンポーネントを起動します:
    • 会話サーバー(Gemma-4)
    • 常駐TaoMateワーカー(GPU 0-1)
    • デコード/ASRワーカー(GPU 2)
    • Webサービス(GPU 3)
  4. http://127.0.0.1:7860/ を開いてブラウザでアバターと対話。
  5. scripts/inference/stop_interactive_avatar_stack.sh ですべてを停止。

リポジトリ構成

apps/interactive_avatar/   # デモUIおよびワーカーコード
configs/inference/         # 例のプロンプトJSONファイル
ltx_*/*                    # コアトランスフォーマー、キャッシュ、デコーダーコード
scripts/inference/         # バッチおよびデモ用起動スクリプト
taomate/inference/         # 高レベル推論ラッパー

ライセンス – コードは Apache 2.0。モデル重みはそれぞれのオリジナルライセンス(LTX-2.3、Gemma、Whisperなど)を保持します。

誰が使うか – 実時間デジタル人間合成を研究する研究者、アバターを活用したチャットやストリーミングサービスを開発する開発者、高スペックGPU上で長時間・同期音声映像生成のリファレンス実装が必要な人。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト