Tencent-Hunyuan/AuK
AuK: An Open-Source Foundational Model for Speech Generation and Editing
AuK – 音声生成・編集のオープンソース基盤モデル
何であるか – AuKは、騰訊・ Hunyuanがリリースした15億パラメータの基盤モデルで、幅広い音声関連タスクに適用可能です。自然言語による指示によって、新しい音声の合成、既存の録音の編集、音質の向上、音源分離がすべて可能になります。
主な機能
- ゼロショットTTS – リファレンス音声クリップの声で音声を生成。
- インストラクションTTS – テキストによる声の説明から合成(リファレンス不要)。
- コンテンツ編集 – 話された単語の置換、挿入、削除(歌詞の編集も可能)。
- 音響編集 – ピッチ、速度、音量の調整。
- 副言語的編集 – 感情、音色の変更、アクセントの除去、非言語音の追加・削除、通常話とささやきの変換。
- 強化・分離 – ノイズ除去、残響除去、話者を分離、音楽ボーカルを抽出、複数話者の分離。
すべてのタスクは単一のメッセージベースAPIを共有:自由形式のテキストによる指示と、必要に応じてソース/リファレンス音声ファイルを提供し、モデルは編集または生成された波形を返します。
モデルバリアント
| バリアント | サイズ | 速度 | 一般的な用途 |
|---|---|---|---|
| AuK(ベース) | 15億パラメータ | フルディフュージョン(ステップ数は設定可能) | 最高品質の生成/編集 |
| AuK-Flash | 同じアーキテクチャ、蒸留版 | 固定4ステップ推論、CFG = 0 | リアルタイムまたは低遅延シナリオ |
両方ともHugging FaceとModelScopeにホストされており、huggingface_hubまたはmodelscope CLIで重みをダウンロード可能です。
クイックスタート
- クローンとセットアップ
git clone https://github.com/Tencent-Hunyuan/AuK cd AuK # uvまたはconda(Python 3.10)を選択 uv venv --python 3.10 && source .venv/bin/activate uv pip install -e "[gradio,train]" # コア+オプションの拡張機能をインストール - チェックポイントのダウンロード
pip install -U "huggingface_hub[cli]" hf download tencent/AuK --local-dir ./ckpts/AuK hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B - CLI例の実行(音声ファイル内のフレーズを置換)
auk-infer \ --audio assets/demo-input-audio/content-edit/content.wav \ --instruction "'but accepting what we cannot have'を'and living well with dreams unmet'に置き換えてください。" \ --output out.wav \ --gen_seconds 7.0 - GradioウェブUIの起動(オプション)
UIではモデルを選択し、音声をアップロード、指示を入力して結果を聞くことができます。auk-gradio \ --base_ckpt ckpts/AuK/auk_base.safetensors \ --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \ --qwen_path ckpts/Qwen2.5-Omni-3B \ --base_device cuda:0 --flash_device cuda:1 \ --dtype bf16
Python API – ライブラリにはAukInferが提供され、LLMで使用されるチャット形式に似たメッセージ辞書のリストを受け取り、NumPy形式の音声配列とサンプルレートを返します。READMEにコンテンツ編集とインストラクションのみのTTSの例スニペットが示されています。
ファインチューニング – 軽量なトレーニングスクリプト(src/auk/train/train.py)は、各エントリに指示、オプションのソース音声、ターゲット音声を含むJSONLファイルを受け取ります。動的バッチ処理はターゲットの再生時間に基づいて行われ、シェルラッパー(scripts/train.sh)も含まれています。
エコシステム統合
- ComfyUI ノードパッケージ(
comfyui/ComfyUI-AuK):視覚的ワークフローパイプライン用。 - プロンプトエンハンサー – OpenAI互換LLM(例:騰訊クラウド TokenHub)を使用して、自由形式のリクエストを正確な
auk-inferコマンドに変換するヘルパー。
ライセンスと引用
- コードはApache-2.0ライセンス(
LICENSEを参照)。 - モデル重みはHugging Face/ModelScopeで別途定義されたモデル固有のライセンスのもと提供。
- 引用形式はREADMEに記載(技術報告のBibTeXエントリ)。
誰が使うか
- 統合音声生成/編集パイプラインを研究する研究者。
- ボイスアシスタント、ダブリングツール、音声後処理ソフトウェアを開発する開発者。
- 新規録音なしで迅速なボイスオーバー生成や音声クリーニングが必要なコンテンツクリエイター。
結論 – AuKは、自然言語インターフェースを介して合成、編集、強化、分離を統合した本格的でオープンソースの大規模音声基盤モデルであり、高品質と低遅延の両方のバリアントを備え、CLI、ウェブUI、Python APIを即時実行可能にしています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト