TaoLiveAIGC/TaoMate

a real-time digital-human model for long-form audio-video generation

TaoMate – 實時音訊・影像數位人生成

是什麼 – TaoMate 是一個研究級系統,可即時合成會說話的數位人(虛擬形象),從一連串文字提示中產生同步的高解析度影片與語音。該程式碼庫包含推論執行環境、多GPU啟動指令碼,以及運行常駐模型工作器的互動式瀏覽器示範。

核心元件

  • 生成器 – 基於 LTX-2.3 22B 轉換器(BF16)建構,採用自訂的 錨點引導記憶橋,可跨最多 12 個提示段(≈ 1 分鐘輸出)維持長時間上下文。
  • 文字編碼器 – Gemma-3 12B IT 模型,用於嵌入提示文字。
  • 對話與規劃 – 可選的 Gemma-4 26B A4B GGUF 模型,用於在互動式示範中即時進行對話與提示規劃。
  • 音訊 – 示範中使用 OpenAI Whisper-tiny 進行語音轉文字(ASR);生成器本身產生音訊軌道。
  • 分散式推論 – 單GPU或雙GPU啟動指令碼將模型分佈於多個裝置;完整示範使用四GPU(生成、文字條件、解碼、對話)。

硬體需求

  • Linux x86_64,Python 3.10
  • 支援 CUDA 12.8 的 NVIDIA GPU;參考 512×768、1 分鐘批次需 72GB VRAM(單GPU峰值 ≈ 66.8 GiB,雙GPU ≈ 各 33.6 GiB)
  • ffmpegtmuxcurl

安裝(摘要)

# 系統相依性
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv

# 程式碼庫設定
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
    --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt

透過 python -c "import torch; print(torch.__version__, torch.cuda.device_count())" 驗證 CUDA 是否正常。

模型權重 – 不儲存在程式碼庫中。您必須從 Hugging Face 下載三個檢查點:

  1. TaoMate (model.pt) – 微調後的生成器。
  2. LTX-2.3 (ltx-2.3-22b-dev.safetensors) – 基礎轉換器。
  3. Gemma-3 12B IT(完整目錄) – 文字編碼器。 請依照 README 中的指令使用 hf download,並將環境變數 MODEL_CKPTBASE_MODEL_CKPTGEMMA_PATH 設定為絕對路徑。

執行推論

  • 批次模式 – 使用提供的 shell 指令碼 run_taomate_1gpu.shrun_taomate_2gpu.sh。提供一個 JSON 列表,其中每個案例包含最多 12 個提示/種子對。輸入格式範例見 README。
  • 輸出 – 生成的影片將寫入 OUTPUT_DIR 指定的目錄,檔名為 <case_id>.mp4

互動式示範

  1. 安裝額外的對話模型(Gemma-4 26B GGUF),並從 ggml-org/llama.cpp 建構支援 CUDA 的 llama-server
  2. 本地下載 Whisper-tiny。
  3. 使用 scripts/inference/start_interactive_avatar_stack.sh 啟動完整堆疊。該指令碼啟動:
    • 對話伺服器(Gemma-4)
    • 常駐 TaoMate 工作器(GPU 0-1)
    • 解碼/ASR 工作器(GPU 2)
    • Web 服務(GPU 3)
  4. 開啟 http://127.0.0.1:7860/,在瀏覽器中與虛擬形象互動。
  5. 使用 scripts/inference/stop_interactive_avatar_stack.sh 停止所有服務。

程式碼庫結構

apps/interactive_avatar/   # 示範 UI 和工作器程式碼
configs/inference/         # 例子提示 JSON 檔案
ltx_*/*                    # 核心轉換器、快取和解碼器程式碼
scripts/inference/         # 批次與示範用啟動指令碼
taomate/inference/         # 高階推論封裝

授權 – 程式碼採用 Apache 2.0。模型權重保留其原始授權(LTX-2.3、Gemma、Whisper 等)。

誰會使用它 – 探索即時數位人合成的研究人員、開發基於虛擬形象的聊天或串流服務的開發者,以及需要在高階 GPU 上實現長時、同步音訊影像生成參考實作的任何人。

相關

  • 專案
  • 專案
  • 專案
  • 專案