Tencent-Hunyuan/AuK

AuK: An Open-Source Foundational Model for Speech Generation and Editing

AuK – 开源语音生成与编辑基础模型

是什么 – AuK 是由腾讯- Hunyuan 发布的 15 亿参数基础模型,适用于广泛的语音相关任务。它可通过自然语言指令实现新语音合成、现有录音编辑、音频质量增强以及音源分离。

核心功能

  • 零样本 TTS – 使用参考音频片段的语音生成新语音。
  • 指令 TTS – 仅通过文本描述语音(无需参考音频)进行合成。
  • 内容编辑 – 替换、插入或删除口语内容,包括歌曲歌词编辑。
  • 声学编辑 – 调整音高、速度和音量。
  • 副语言编辑 – 改变情绪、音色,去除口音,添加/移除非语言声音,实现正常说话与低语之间的转换。
  • 增强与分离 – 去噪、去混响、分离说话人、提取音乐人声,或分离多个说话人。

所有任务共享单一的 基于消息 的 API:您提供一条自由格式的指令(文本)和可选的源/参考音频文件,模型将返回编辑或生成的波形。

模型变体

变体 大小 速度 典型用途
AuK(基础) 15 亿参数 完整扩散(可配置步数) 最高质量的生成/编辑
AuK-Flash 相同架构,蒸馏版 固定 4 步推理,CFG = 0 实时或低延迟场景

两者均托管于 Hugging Face 和 ModelScope;可通过 huggingface_hubmodelscope CLI 下载权重。

快速开始

  1. 克隆与设置
    git clone https://github.com/Tencent-Hunyuan/AuK
    cd AuK
    # 选择 uv 或 conda(Python 3.10)
    uv venv --python 3.10 && source .venv/bin/activate
    uv pip install -e "[gradio,train]"   # 安装核心 + 可选扩展
    
  2. 下载检查点
    pip install -U "huggingface_hub[cli]"
    hf download tencent/AuK --local-dir ./ckpts/AuK
    hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash
    hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B
    
  3. 运行 CLI 示例(替换音频文件中的短语)
    auk-infer \
      --audio assets/demo-input-audio/content-edit/content.wav \
      --instruction "将 'but accepting what we cannot have' 替换为 'and living well with dreams unmet'。" \
      --output out.wav \
      --gen_seconds 7.0
    
  4. 启动 Gradio Web UI(可选)
    auk-gradio \
      --base_ckpt ckpts/AuK/auk_base.safetensors \
      --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \
      --qwen_path ckpts/Qwen2.5-Omni-3B \
      --base_device cuda:0 --flash_device cuda:1 \
      --dtype bf16
    
    UI 允许您选择模型、上传音频、输入指令并收听结果。

Python API – 该库提供 AukInfer,接受与 LLM 聊天格式相似的消息字典列表,并返回 NumPy 音频数组和采样率。README 中展示了内容编辑和仅指令 TTS 的示例代码片段。

微调 – 轻量级训练脚本(src/auk/train/train.py)接受 JSONL 文件,每个条目包含指令、可选源音频和目标音频。动态批处理基于目标时长驱动,仓库还包含一个 Shell 包装器(scripts/train.sh)。

生态系统集成

  • ComfyUI 节点包(comfyui/ComfyUI-AuK)用于可视化工作流管道。
  • 提示增强器 – 使用 OpenAI 兼容 LLM(如腾讯云 TokenHub)将自由格式请求转换为精确的 auk-infer 命令的辅助工具。

许可与引用

  • 代码采用 Apache-2.0 许可证(参见 LICENSE)。
  • 模型权重在 Hugging Face/ModelScope 上以独立的模型特定许可证提供。
  • 引用格式在 README 中提供(技术报告的 BibTeX 条目)。

谁会使用它

  • 探索统一语音生成/编辑流水线的研究人员。
  • 构建语音助手、配音工具或音频后期制作软件的开发者。
  • 需要快速生成配音或清理音频但无需重新录制内容的内容创作者。

总结 – AuK 是一个真正的开源、大规模语音基础模型,通过单一自然语言接口统一了合成、编辑、增强和分离功能,提供高质量和低延迟两种版本,具备即开即用的 CLI、Web UI 和 Python API。

相关

  • 项目
  • 项目
  • 项目
  • 项目