TaoLiveAIGC/TaoMate
a real-time digital-human model for long-form audio-video generation
TaoMate – 實時音訊・影像數位人生成
是什麼 – TaoMate 是一個研究級系統,可即時合成會說話的數位人(虛擬形象),從一連串文字提示中產生同步的高解析度影片與語音。該程式碼庫包含推論執行環境、多GPU啟動指令碼,以及運行常駐模型工作器的互動式瀏覽器示範。
核心元件
- 生成器 – 基於 LTX-2.3 22B 轉換器(BF16)建構,採用自訂的 錨點引導記憶橋,可跨最多 12 個提示段(≈ 1 分鐘輸出)維持長時間上下文。
- 文字編碼器 – Gemma-3 12B IT 模型,用於嵌入提示文字。
- 對話與規劃 – 可選的 Gemma-4 26B A4B GGUF 模型,用於在互動式示範中即時進行對話與提示規劃。
- 音訊 – 示範中使用 OpenAI Whisper-tiny 進行語音轉文字(ASR);生成器本身產生音訊軌道。
- 分散式推論 – 單GPU或雙GPU啟動指令碼將模型分佈於多個裝置;完整示範使用四GPU(生成、文字條件、解碼、對話)。
硬體需求
- Linux x86_64,Python 3.10
- 支援 CUDA 12.8 的 NVIDIA GPU;參考 512×768、1 分鐘批次需 72GB VRAM(單GPU峰值 ≈ 66.8 GiB,雙GPU ≈ 各 33.6 GiB)
ffmpeg,tmux,curl
安裝(摘要)
# 系統相依性
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv
# 程式碼庫設定
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
--index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
透過 python -c "import torch; print(torch.__version__, torch.cuda.device_count())" 驗證 CUDA 是否正常。
模型權重 – 不儲存在程式碼庫中。您必須從 Hugging Face 下載三個檢查點:
- TaoMate (
model.pt) – 微調後的生成器。 - LTX-2.3 (
ltx-2.3-22b-dev.safetensors) – 基礎轉換器。 - Gemma-3 12B IT(完整目錄) – 文字編碼器。
請依照 README 中的指令使用
hf download,並將環境變數MODEL_CKPT、BASE_MODEL_CKPT和GEMMA_PATH設定為絕對路徑。
執行推論
- 批次模式 – 使用提供的 shell 指令碼
run_taomate_1gpu.sh或run_taomate_2gpu.sh。提供一個 JSON 列表,其中每個案例包含最多 12 個提示/種子對。輸入格式範例見 README。 - 輸出 – 生成的影片將寫入
OUTPUT_DIR指定的目錄,檔名為<case_id>.mp4。
互動式示範
- 安裝額外的對話模型(Gemma-4 26B GGUF),並從
ggml-org/llama.cpp建構支援 CUDA 的llama-server。 - 本地下載 Whisper-tiny。
- 使用
scripts/inference/start_interactive_avatar_stack.sh啟動完整堆疊。該指令碼啟動:- 對話伺服器(Gemma-4)
- 常駐 TaoMate 工作器(GPU 0-1)
- 解碼/ASR 工作器(GPU 2)
- Web 服務(GPU 3)
- 開啟
http://127.0.0.1:7860/,在瀏覽器中與虛擬形象互動。 - 使用
scripts/inference/stop_interactive_avatar_stack.sh停止所有服務。
程式碼庫結構
apps/interactive_avatar/ # 示範 UI 和工作器程式碼
configs/inference/ # 例子提示 JSON 檔案
ltx_*/* # 核心轉換器、快取和解碼器程式碼
scripts/inference/ # 批次與示範用啟動指令碼
taomate/inference/ # 高階推論封裝
授權 – 程式碼採用 Apache 2.0。模型權重保留其原始授權(LTX-2.3、Gemma、Whisper 等)。
誰會使用它 – 探索即時數位人合成的研究人員、開發基於虛擬形象的聊天或串流服務的開發者,以及需要在高階 GPU 上實現長時、同步音訊影像生成參考實作的任何人。
相關
- 專案
- 專案
- 專案
- 專案