TaoLiveAIGC/TaoMate

a real-time digital-human model for long-form audio-video generation

TaoMate – 实时音视频数字人生成

是什么 – TaoMate 是一个研究级系统,可实时合成会说话的数字人(虚拟形象),从一系列文本提示中生成同步的高分辨率视频和语音。该仓库包含推理运行时、多GPU启动脚本,以及运行驻留模型工作器的交互式浏览器演示。

核心组件

  • 生成器 – 基于 LTX-2.3 22B 变压器(BF16)构建,采用自定义的 锚点引导记忆桥,可跨最多 12 个提示段(≈ 1 分钟输出)保持长时上下文。
  • 文本编码器 – Gemma-3 12B IT 模型,用于嵌入提示文本。
  • 对话与规划 – 可选的 Gemma-4 26B A4B GGUF 模型,用于在交互式演示中实时进行对话和提示规划。
  • 音频 – 演示中使用 OpenAI Whisper-tiny 进行语音识别(ASR);生成器本身生成音频轨道。
  • 分布式推理 – 单GPU或双GPU启动脚本将模型分摊到多个设备;完整演示使用四GPU(生成、文本条件、解码、对话)。

硬件要求

  • Linux x86_64,Python 3.10
  • 支持 CUDA 12.8 的 NVIDIA GPU;参考 512×768、1 分钟批次需 72GB VRAM(单GPU峰值 ≈ 66.8 GiB,双GPU ≈ 各 33.6 GiB)
  • ffmpegtmuxcurl

安装(概要)

# 系统依赖
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv

# 仓库设置
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
    --index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt

通过 python -c "import torch; print(torch.__version__, torch.cuda.device_count())" 验证 CUDA 是否正常。

模型权重 – 不存储在仓库中。您必须从 Hugging Face 下载三个检查点:

  1. TaoMate (model.pt) – 微调后的生成器。
  2. LTX-2.3 (ltx-2.3-22b-dev.safetensors) – 基础变压器。
  3. Gemma-3 12B IT(完整目录) – 文本编码器。 请按照 README 中的命令使用 hf download,并将环境变量 MODEL_CKPTBASE_MODEL_CKPTGEMMA_PATH 设置为绝对路径。

运行推理

  • 批量模式 – 使用提供的 shell 脚本 run_taomate_1gpu.shrun_taomate_2gpu.sh。提供一个 JSON 列表,其中每个案例包含最多 12 个提示/种子对。输入格式示例见 README。
  • 输出 – 生成的视频将写入 OUTPUT_DIR 指定的目录,文件名为 <case_id>.mp4

交互式演示

  1. 安装额外的对话模型(Gemma-4 26B GGUF),并从 ggml-org/llama.cpp 构建一个支持 CUDA 的 llama-server
  2. 本地下载 Whisper-tiny。
  3. 使用 scripts/inference/start_interactive_avatar_stack.sh 启动完整堆栈。该脚本启动:
    • 对话服务器(Gemma-4)
    • 驻留 TaoMate 工作器(GPU 0-1)
    • 解码/ASR 工作器(GPU 2)
    • Web 服务(GPU 3)
  4. 打开 http://127.0.0.1:7860/,在浏览器中与虚拟形象互动。
  5. 使用 scripts/inference/stop_interactive_avatar_stack.sh 停止所有服务。

仓库结构

apps/interactive_avatar/   # 演示 UI 和工作器代码
configs/inference/         # 示例提示 JSON 文件
ltx_*/*                    # 核心变压器、缓存和解码器代码
scripts/inference/         # 批量和演示用启动脚本
taomate/inference/         # 高层推理封装

许可证 – 代码采用 Apache 2.0。模型权重保留其原始许可证(LTX-2.3、Gemma、Whisper 等)。

谁会使用它 – 探索实时数字人合成的研究人员、开发基于虚拟形象的聊天或流媒体服务的开发者,以及需要在高端 GPU 上实现长时、同步音视频生成参考实现的任何人。

相关

  • 项目
  • 项目
  • 项目
  • 项目