TaoLiveAIGC/TaoMate
a real-time digital-human model for long-form audio-video generation
TaoMate – 实时音视频数字人生成
是什么 – TaoMate 是一个研究级系统,可实时合成会说话的数字人(虚拟形象),从一系列文本提示中生成同步的高分辨率视频和语音。该仓库包含推理运行时、多GPU启动脚本,以及运行驻留模型工作器的交互式浏览器演示。
核心组件
- 生成器 – 基于 LTX-2.3 22B 变压器(BF16)构建,采用自定义的 锚点引导记忆桥,可跨最多 12 个提示段(≈ 1 分钟输出)保持长时上下文。
- 文本编码器 – Gemma-3 12B IT 模型,用于嵌入提示文本。
- 对话与规划 – 可选的 Gemma-4 26B A4B GGUF 模型,用于在交互式演示中实时进行对话和提示规划。
- 音频 – 演示中使用 OpenAI Whisper-tiny 进行语音识别(ASR);生成器本身生成音频轨道。
- 分布式推理 – 单GPU或双GPU启动脚本将模型分摊到多个设备;完整演示使用四GPU(生成、文本条件、解码、对话)。
硬件要求
- Linux x86_64,Python 3.10
- 支持 CUDA 12.8 的 NVIDIA GPU;参考 512×768、1 分钟批次需 72GB VRAM(单GPU峰值 ≈ 66.8 GiB,双GPU ≈ 各 33.6 GiB)
ffmpeg,tmux,curl
安装(概要)
# 系统依赖
sudo apt-get update && sudo apt-get install -y build-essential cmake curl ffmpeg git tmux python3-venv
# 仓库设置
cd TaoMate
python3.10 -m venv .venv && source .venv/bin/activate
pip install --upgrade pip
pip install torch==2.8.0 torchvision==0.23.0 torchaudio==2.8.0 \
--index-url https://download.pytorch.org/whl/cu128
pip install -r requirements.txt
通过 python -c "import torch; print(torch.__version__, torch.cuda.device_count())" 验证 CUDA 是否正常。
模型权重 – 不存储在仓库中。您必须从 Hugging Face 下载三个检查点:
- TaoMate (
model.pt) – 微调后的生成器。 - LTX-2.3 (
ltx-2.3-22b-dev.safetensors) – 基础变压器。 - Gemma-3 12B IT(完整目录) – 文本编码器。
请按照 README 中的命令使用
hf download,并将环境变量MODEL_CKPT、BASE_MODEL_CKPT和GEMMA_PATH设置为绝对路径。
运行推理
- 批量模式 – 使用提供的 shell 脚本
run_taomate_1gpu.sh或run_taomate_2gpu.sh。提供一个 JSON 列表,其中每个案例包含最多 12 个提示/种子对。输入格式示例见 README。 - 输出 – 生成的视频将写入
OUTPUT_DIR指定的目录,文件名为<case_id>.mp4。
交互式演示
- 安装额外的对话模型(Gemma-4 26B GGUF),并从
ggml-org/llama.cpp构建一个支持 CUDA 的llama-server。 - 本地下载 Whisper-tiny。
- 使用
scripts/inference/start_interactive_avatar_stack.sh启动完整堆栈。该脚本启动:- 对话服务器(Gemma-4)
- 驻留 TaoMate 工作器(GPU 0-1)
- 解码/ASR 工作器(GPU 2)
- Web 服务(GPU 3)
- 打开
http://127.0.0.1:7860/,在浏览器中与虚拟形象互动。 - 使用
scripts/inference/stop_interactive_avatar_stack.sh停止所有服务。
仓库结构
apps/interactive_avatar/ # 演示 UI 和工作器代码
configs/inference/ # 示例提示 JSON 文件
ltx_*/* # 核心变压器、缓存和解码器代码
scripts/inference/ # 批量和演示用启动脚本
taomate/inference/ # 高层推理封装
许可证 – 代码采用 Apache 2.0。模型权重保留其原始许可证(LTX-2.3、Gemma、Whisper 等)。
谁会使用它 – 探索实时数字人合成的研究人员、开发基于虚拟形象的聊天或流媒体服务的开发者,以及需要在高端 GPU 上实现长时、同步音视频生成参考实现的任何人。
相关
- 项目
- 项目
- 项目
- 项目