Tencent-Hunyuan/AuK
AuK: An Open-Source Foundational Model for Speech Generation and Editing
AuK – 開源語音生成與編輯基礎模型
是什麼 – AuK 是由騰訊- Hunyuan 發布的 15 億參數基礎模型,適用於廣泛的語音相關任務。它可透過自然語言指令進行新語音合成、現有錄音編輯、音質增強以及音源分離。
核心功能
- 零樣本 TTS – 使用參考音訊片段的語音生成新語音。
- 指令 TTS – 僅透過文字描述語音(無需參考)進行合成。
- 內容編輯 – 替換、插入或刪除口語內容,包括歌曲歌詞編輯。
- 聲學編輯 – 調整音高、速度和音量。
- 副語言編輯 – 改變情緒、音色,去除口音,添加/移除非語言聲音,實現正常說話與低語之間的轉換。
- 增強與分離 – 去噪、去混響、分離說話人、提取音樂人聲,或分離多個說話人。
所有任務共享單一的 基於訊息 的 API:您提供一條自由格式的指令(文字)和可選的來源/參考音訊檔案,模型將回傳編輯或生成的波形。
模型變體
| 變體 | 大小 | 速度 | 典型用途 |
|---|---|---|---|
| AuK(基礎) | 15 億參數 | 完整擴散(可設定步數) | 最高品質的生成/編輯 |
| AuK-Flash | 相同架構,蒸餾版 | 固定 4 步推理,CFG = 0 | 實時或低延遲場景 |
兩者均托管於 Hugging Face 和 ModelScope;可透過 huggingface_hub 或 modelscope CLI 下載權重。
快速開始
- 克隆與設定
git clone https://github.com/Tencent-Hunyuan/AuK cd AuK # 選擇 uv 或 conda(Python 3.10) uv venv --python 3.10 && source .venv/bin/activate uv pip install -e "[gradio,train]" # 安裝核心 + 可選擴充 - 下載檢查點
pip install -U "huggingface_hub[cli]" hf download tencent/AuK --local-dir ./ckpts/AuK hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B - 執行 CLI 範例(替換音訊檔案中的短語)
auk-infer \ --audio assets/demo-input-audio/content-edit/content.wav \ --instruction "將 'but accepting what we cannot have' 替換為 'and living well with dreams unmet'。" \ --output out.wav \ --gen_seconds 7.0 - 啟動 Gradio Web UI(可選)
UI 允許您選擇模型、上傳音訊、輸入指令並聆聽結果。auk-gradio \ --base_ckpt ckpts/AuK/auk_base.safetensors \ --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \ --qwen_path ckpts/Qwen2.5-Omni-3B \ --base_device cuda:0 --flash_device cuda:1 \ --dtype bf16
Python API – 該庫提供 AukInfer,接受與 LLM 聊天格式相似的訊息字典列表,並回傳 NumPy 音訊陣列與取樣率。README 中展示了內容編輯與僅指令 TTS 的範例程式碼片段。
微調 – 輕量級訓練腳本(src/auk/train/train.py)接受 JSONL 檔案,每個項目包含指令、可選來源音訊與目標音訊。動態批次處理由目標時長驅動,倉儲還包含一個 Shell 包裝器(scripts/train.sh)。
生態系統整合
- ComfyUI 節點套件(
comfyui/ComfyUI-AuK)用於視覺化工作流程管道。 - 提示增強器 – 使用 OpenAI 相容 LLM(如騰訊雲 TokenHub)將自由格式請求轉換為精確的
auk-infer命令的輔助工具。
授權與引用
- 代碼採用 Apache-2.0 授權(參見
LICENSE)。 - 模型權重在 Hugging Face/ModelScope 上以獨立的模型特定授權提供。
- 引用格式在 README 中提供(技術報告的 BibTeX 條目)。
誰會使用它
- 探索統一語音生成/編輯流程的研究人員。
- 建構語音助理、配音工具或音訊後製軟體的開發者。
- 需要快速生成配音或清理音訊但無需重新錄製內容的內容創作者。
總結 – AuK 是一個真正的開源、大規模語音基礎模型,透過單一自然語言介面統合了合成、編輯、增強與分離功能,提供高品質與低延遲兩種版本,具備即開即用的 CLI、Web UI 與 Python API。
相關
- 專案
- 專案
- 專案
- 專案