Tencent-Hunyuan/AuK

AuK: An Open-Source Foundational Model for Speech Generation and Editing

AuK – 音声生成・編集のオープンソース基盤モデル

何であるか – AuKは、騰訊・ Hunyuanがリリースした15億パラメータの基盤モデルで、幅広い音声関連タスクに適用可能です。自然言語による指示によって、新しい音声の合成、既存の録音の編集、音質の向上、音源分離がすべて可能になります。

主な機能

  • ゼロショットTTS – リファレンス音声クリップの声で音声を生成。
  • インストラクションTTS – テキストによる声の説明から合成(リファレンス不要)。
  • コンテンツ編集 – 話された単語の置換、挿入、削除(歌詞の編集も可能)。
  • 音響編集 – ピッチ、速度、音量の調整。
  • 副言語的編集 – 感情、音色の変更、アクセントの除去、非言語音の追加・削除、通常話とささやきの変換。
  • 強化・分離 – ノイズ除去、残響除去、話者を分離、音楽ボーカルを抽出、複数話者の分離。

すべてのタスクは単一のメッセージベースAPIを共有:自由形式のテキストによる指示と、必要に応じてソース/リファレンス音声ファイルを提供し、モデルは編集または生成された波形を返します。

モデルバリアント

バリアント サイズ 速度 一般的な用途
AuK(ベース) 15億パラメータ フルディフュージョン(ステップ数は設定可能) 最高品質の生成/編集
AuK-Flash 同じアーキテクチャ、蒸留版 固定4ステップ推論、CFG = 0 リアルタイムまたは低遅延シナリオ

両方ともHugging FaceとModelScopeにホストされており、huggingface_hubまたはmodelscope CLIで重みをダウンロード可能です。

クイックスタート

  1. クローンとセットアップ
    git clone https://github.com/Tencent-Hunyuan/AuK
    cd AuK
    # uvまたはconda(Python 3.10)を選択
    uv venv --python 3.10 && source .venv/bin/activate
    uv pip install -e "[gradio,train]"   # コア+オプションの拡張機能をインストール
    
  2. チェックポイントのダウンロード
    pip install -U "huggingface_hub[cli]"
    hf download tencent/AuK --local-dir ./ckpts/AuK
    hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash
    hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B
    
  3. CLI例の実行(音声ファイル内のフレーズを置換)
    auk-infer \
      --audio assets/demo-input-audio/content-edit/content.wav \
      --instruction "'but accepting what we cannot have'を'and living well with dreams unmet'に置き換えてください。" \
      --output out.wav \
      --gen_seconds 7.0
    
  4. GradioウェブUIの起動(オプション)
    auk-gradio \
      --base_ckpt ckpts/AuK/auk_base.safetensors \
      --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \
      --qwen_path ckpts/Qwen2.5-Omni-3B \
      --base_device cuda:0 --flash_device cuda:1 \
      --dtype bf16
    
    UIではモデルを選択し、音声をアップロード、指示を入力して結果を聞くことができます。

Python API – ライブラリにはAukInferが提供され、LLMで使用されるチャット形式に似たメッセージ辞書のリストを受け取り、NumPy形式の音声配列とサンプルレートを返します。READMEにコンテンツ編集とインストラクションのみのTTSの例スニペットが示されています。

ファインチューニング – 軽量なトレーニングスクリプト(src/auk/train/train.py)は、各エントリに指示、オプションのソース音声、ターゲット音声を含むJSONLファイルを受け取ります。動的バッチ処理はターゲットの再生時間に基づいて行われ、シェルラッパー(scripts/train.sh)も含まれています。

エコシステム統合

  • ComfyUI ノードパッケージ(comfyui/ComfyUI-AuK):視覚的ワークフローパイプライン用。
  • プロンプトエンハンサー – OpenAI互換LLM(例:騰訊クラウド TokenHub)を使用して、自由形式のリクエストを正確なauk-inferコマンドに変換するヘルパー。

ライセンスと引用

  • コードはApache-2.0ライセンス(LICENSEを参照)。
  • モデル重みはHugging Face/ModelScopeで別途定義されたモデル固有のライセンスのもと提供。
  • 引用形式はREADMEに記載(技術報告のBibTeXエントリ)。

誰が使うか

  • 統合音声生成/編集パイプラインを研究する研究者。
  • ボイスアシスタント、ダブリングツール、音声後処理ソフトウェアを開発する開発者。
  • 新規録音なしで迅速なボイスオーバー生成や音声クリーニングが必要なコンテンツクリエイター。

結論 – AuKは、自然言語インターフェースを介して合成、編集、強化、分離を統合した本格的でオープンソースの大規模音声基盤モデルであり、高品質と低遅延の両方のバリアントを備え、CLI、ウェブUI、Python APIを即時実行可能にしています。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト