Tencent-Hunyuan/AuK
AuK: An Open-Source Foundational Model for Speech Generation and Editing
AuK – 음성 생성 및 편집을 위한 오픈소스 기초 모델
무엇인가요 – AuK는 텐센트-훈위안이 출시한 15억 파라미터 기초 모델로, 다양한 음성 관련 작업에 활용할 수 있습니다. 자연어 지시를 통해 새로운 음성을 합성하고, 기존 녹음물을 편집하며, 음질을 향상시키고, 음원을 분리할 수 있습니다.
주요 기능
- 제로샷 TTS – 참조 오디오 클립의 목소리로 음성 생성.
- 지시 기반 TTS – 참조 없이 텍스트 기반 목소리 설명으로 음성 합성.
- 콘텐츠 편집 – 말한 단어 교체, 삽입, 삭제 (노래 가사 편집 포함).
- 음향 편집 – 음높이, 속도, 볼륨 조정.
- 부언적 편집 – 감정, 음색 변경, 억양 제거, 비언어적 소리 추가/제거, 일반 발화와 속삭임 간 전환.
- 강화 및 분리 – 노이즈 제거, 리버버베이션 제거, 화자 분리, 음악 보컬 추출, 다수 화자 분리.
모든 작업은 단일한 메시지 기반 API를 공유합니다: 자유 형식의 지시문과 선택적으로 소스/참조 오디오 파일을 제공하면, 모델은 편집 또는 생성된 파형을 반환합니다.
모델 버전
| 버전 | 크기 | 속도 | 일반적인 사용 사례 |
|---|---|---|---|
| AuK (기본) | 15억 파라미터 | 전체 디퓨전 (설정 가능한 스텝 수) | 최고 품질의 생성/편집 |
| AuK-Flash | 동일한 아키텍처, 증류된 버전 | 고정 4단계 추론, CFG = 0 | 실시간 또는 낮은 지연 시나리오 |
두 모델 모두 Hugging Face와 ModelScope에 호스팅되어 있으며, huggingface_hub 또는 modelscope CLI로 가중치를 다운로드할 수 있습니다.
빠른 시작
- 클론 및 설정
git clone https://github.com/Tencent-Hunyuan/AuK cd AuK # uv 또는 conda (Python 3.10) 선택 uv venv --python 3.10 && source .venv/bin/activate uv pip install -e "[gradio,train]" # 핵심 + 선택적 확장 기능 설치 - 체크포인트 다운로드
pip install -U "huggingface_hub[cli]" hf download tencent/AuK --local-dir ./ckpts/AuK hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B - CLI 예제 실행 (오디오 파일 내 문장 교체)
auk-infer \ --audio assets/demo-input-audio/content-edit/content.wav \ --instruction "'but accepting what we cannot have'을 'and living well with dreams unmet'로 바꿔주세요." \ --output out.wav \ --gen_seconds 7.0 - Gradio 웹 UI 실행 (선택 사항)
UI를 통해 모델을 선택하고 오디오를 업로드하며 지시문을 입력한 후 결과를 들을 수 있습니다.auk-gradio \ --base_ckpt ckpts/AuK/auk_base.safetensors \ --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \ --qwen_path ckpts/Qwen2.5-Omni-3B \ --base_device cuda:0 --flash_device cuda:1 \ --dtype bf16
Python API – 라이브러리는 AukInfer를 제공하며, LLM에서 사용되는 채팅 스타일 형식과 유사한 메시지 사전 리스트를 받아 NumPy 오디오 배열과 샘플 레이트를 반환합니다. README에 콘텐츠 편집 및 지시어만 사용하는 TTS 예제 스크립트가 포함되어 있습니다.
파인튜닝 – 가벼운 학습 스크립트 (src/auk/train/train.py)는 각 항목에 지시어, 선택적 소스 오디오, 타겟 오디오가 포함된 JSONL 파일을 수용합니다. 동적 배치는 타겟 지속 시간에 따라 결정되며, 쉘 래퍼 (scripts/train.sh)도 포함되어 있습니다.
에코시스템 통합
- ComfyUI 노드 패키지 (
comfyui/ComfyUI-AuK) – 시각적 워크플로우 파이프라인용. - 프롬프트 엔ハン서 – OpenAI 호환 LLM(예: 텐센트 클라우드 TokenHub)을 사용해 자유 형식 요청을 정확한
auk-infer명령어로 변환하는 보조 도구.
라이선스 및 인용
- 코드는 Apache-2.0 라이선스로 배포됩니다 (자세한 내용은
LICENSE참조). - 모델 가중치는 Hugging Face/ModelScope에서 별도의 모델 전용 라이선스 하에 제공됩니다.
- 인용 형식은 README에 제공되며, 기술 보고서용 BibTeX 항목 포함.
누가 사용할 수 있나요
- 통합 음성 생성/편집 파이프라인을 탐구하는 연구자.
- 음성 어시스턴트, 더빙 도구, 오디오 후처리 소프트웨어를 개발하는 개발자.
- 새로운 녹음을 하지 않고도 빠르게 보이스오버 생성 또는 오디오 정리가 필요한 콘텐츠 제작자.
결론 – AuK는 자연어 인터페이스를 통해 합성, 편집, 강화, 분리를 통합한 진정한 오픈소스 대규모 음성 기초 모델로, 고품질 및 저지연 버전을 모두 제공하며, 즉시 실행 가능한 CLI, 웹 UI, Python API를 갖추고 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트