Tencent-Hunyuan/AuK
AuK: An Open-Source Foundational Model for Speech Generation and Editing
AuK – 开源语音生成与编辑基础模型
是什么 – AuK 是由腾讯- Hunyuan 发布的 15 亿参数基础模型,适用于广泛的语音相关任务。它可通过自然语言指令实现新语音合成、现有录音编辑、音频质量增强以及音源分离。
核心功能
- 零样本 TTS – 使用参考音频片段的语音生成新语音。
- 指令 TTS – 仅通过文本描述语音(无需参考音频)进行合成。
- 内容编辑 – 替换、插入或删除口语内容,包括歌曲歌词编辑。
- 声学编辑 – 调整音高、速度和音量。
- 副语言编辑 – 改变情绪、音色,去除口音,添加/移除非语言声音,实现正常说话与低语之间的转换。
- 增强与分离 – 去噪、去混响、分离说话人、提取音乐人声,或分离多个说话人。
所有任务共享单一的 基于消息 的 API:您提供一条自由格式的指令(文本)和可选的源/参考音频文件,模型将返回编辑或生成的波形。
模型变体
| 变体 | 大小 | 速度 | 典型用途 |
|---|---|---|---|
| AuK(基础) | 15 亿参数 | 完整扩散(可配置步数) | 最高质量的生成/编辑 |
| AuK-Flash | 相同架构,蒸馏版 | 固定 4 步推理,CFG = 0 | 实时或低延迟场景 |
两者均托管于 Hugging Face 和 ModelScope;可通过 huggingface_hub 或 modelscope CLI 下载权重。
快速开始
- 克隆与设置
git clone https://github.com/Tencent-Hunyuan/AuK cd AuK # 选择 uv 或 conda(Python 3.10) uv venv --python 3.10 && source .venv/bin/activate uv pip install -e "[gradio,train]" # 安装核心 + 可选扩展 - 下载检查点
pip install -U "huggingface_hub[cli]" hf download tencent/AuK --local-dir ./ckpts/AuK hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B - 运行 CLI 示例(替换音频文件中的短语)
auk-infer \ --audio assets/demo-input-audio/content-edit/content.wav \ --instruction "将 'but accepting what we cannot have' 替换为 'and living well with dreams unmet'。" \ --output out.wav \ --gen_seconds 7.0 - 启动 Gradio Web UI(可选)
UI 允许您选择模型、上传音频、输入指令并收听结果。auk-gradio \ --base_ckpt ckpts/AuK/auk_base.safetensors \ --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \ --qwen_path ckpts/Qwen2.5-Omni-3B \ --base_device cuda:0 --flash_device cuda:1 \ --dtype bf16
Python API – 该库提供 AukInfer,接受与 LLM 聊天格式相似的消息字典列表,并返回 NumPy 音频数组和采样率。README 中展示了内容编辑和仅指令 TTS 的示例代码片段。
微调 – 轻量级训练脚本(src/auk/train/train.py)接受 JSONL 文件,每个条目包含指令、可选源音频和目标音频。动态批处理基于目标时长驱动,仓库还包含一个 Shell 包装器(scripts/train.sh)。
生态系统集成
- ComfyUI 节点包(
comfyui/ComfyUI-AuK)用于可视化工作流管道。 - 提示增强器 – 使用 OpenAI 兼容 LLM(如腾讯云 TokenHub)将自由格式请求转换为精确的
auk-infer命令的辅助工具。
许可与引用
- 代码采用 Apache-2.0 许可证(参见
LICENSE)。 - 模型权重在 Hugging Face/ModelScope 上以独立的模型特定许可证提供。
- 引用格式在 README 中提供(技术报告的 BibTeX 条目)。
谁会使用它
- 探索统一语音生成/编辑流水线的研究人员。
- 构建语音助手、配音工具或音频后期制作软件的开发者。
- 需要快速生成配音或清理音频但无需重新录制内容的内容创作者。
总结 – AuK 是一个真正的开源、大规模语音基础模型,通过单一自然语言接口统一了合成、编辑、增强和分离功能,提供高质量和低延迟两种版本,具备即开即用的 CLI、Web UI 和 Python API。
相关
- 项目
- 项目
- 项目
- 项目