Tencent-Hunyuan/AuK

AuK: An Open-Source Foundational Model for Speech Generation and Editing

AuK – 開源語音生成與編輯基礎模型

是什麼 – AuK 是由騰訊- Hunyuan 發布的 15 億參數基礎模型,適用於廣泛的語音相關任務。它可透過自然語言指令進行新語音合成、現有錄音編輯、音質增強以及音源分離。

核心功能

  • 零樣本 TTS – 使用參考音訊片段的語音生成新語音。
  • 指令 TTS – 僅透過文字描述語音(無需參考)進行合成。
  • 內容編輯 – 替換、插入或刪除口語內容,包括歌曲歌詞編輯。
  • 聲學編輯 – 調整音高、速度和音量。
  • 副語言編輯 – 改變情緒、音色,去除口音,添加/移除非語言聲音,實現正常說話與低語之間的轉換。
  • 增強與分離 – 去噪、去混響、分離說話人、提取音樂人聲,或分離多個說話人。

所有任務共享單一的 基於訊息 的 API:您提供一條自由格式的指令(文字)和可選的來源/參考音訊檔案,模型將回傳編輯或生成的波形。

模型變體

變體 大小 速度 典型用途
AuK(基礎) 15 億參數 完整擴散(可設定步數) 最高品質的生成/編輯
AuK-Flash 相同架構,蒸餾版 固定 4 步推理,CFG = 0 實時或低延遲場景

兩者均托管於 Hugging Face 和 ModelScope;可透過 huggingface_hubmodelscope CLI 下載權重。

快速開始

  1. 克隆與設定
    git clone https://github.com/Tencent-Hunyuan/AuK
    cd AuK
    # 選擇 uv 或 conda(Python 3.10)
    uv venv --python 3.10 && source .venv/bin/activate
    uv pip install -e "[gradio,train]"   # 安裝核心 + 可選擴充
    
  2. 下載檢查點
    pip install -U "huggingface_hub[cli]"
    hf download tencent/AuK --local-dir ./ckpts/AuK
    hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash
    hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B
    
  3. 執行 CLI 範例(替換音訊檔案中的短語)
    auk-infer \
      --audio assets/demo-input-audio/content-edit/content.wav \
      --instruction "將 'but accepting what we cannot have' 替換為 'and living well with dreams unmet'。" \
      --output out.wav \
      --gen_seconds 7.0
    
  4. 啟動 Gradio Web UI(可選)
    auk-gradio \
      --base_ckpt ckpts/AuK/auk_base.safetensors \
      --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \
      --qwen_path ckpts/Qwen2.5-Omni-3B \
      --base_device cuda:0 --flash_device cuda:1 \
      --dtype bf16
    
    UI 允許您選擇模型、上傳音訊、輸入指令並聆聽結果。

Python API – 該庫提供 AukInfer,接受與 LLM 聊天格式相似的訊息字典列表,並回傳 NumPy 音訊陣列與取樣率。README 中展示了內容編輯與僅指令 TTS 的範例程式碼片段。

微調 – 輕量級訓練腳本(src/auk/train/train.py)接受 JSONL 檔案,每個項目包含指令、可選來源音訊與目標音訊。動態批次處理由目標時長驅動,倉儲還包含一個 Shell 包裝器(scripts/train.sh)。

生態系統整合

  • ComfyUI 節點套件(comfyui/ComfyUI-AuK)用於視覺化工作流程管道。
  • 提示增強器 – 使用 OpenAI 相容 LLM(如騰訊雲 TokenHub)將自由格式請求轉換為精確的 auk-infer 命令的輔助工具。

授權與引用

  • 代碼採用 Apache-2.0 授權(參見 LICENSE)。
  • 模型權重在 Hugging Face/ModelScope 上以獨立的模型特定授權提供。
  • 引用格式在 README 中提供(技術報告的 BibTeX 條目)。

誰會使用它

  • 探索統一語音生成/編輯流程的研究人員。
  • 建構語音助理、配音工具或音訊後製軟體的開發者。
  • 需要快速生成配音或清理音訊但無需重新錄製內容的內容創作者。

總結 – AuK 是一個真正的開源、大規模語音基礎模型,透過單一自然語言介面統合了合成、編輯、增強與分離功能,提供高品質與低延遲兩種版本,具備即開即用的 CLI、Web UI 與 Python API。

相關

  • 專案
  • 專案
  • 專案
  • 專案