Tencent-Hunyuan/AuK

AuK: An Open-Source Foundational Model for Speech Generation and Editing

AuK – 음성 생성 및 편집을 위한 오픈소스 기초 모델

무엇인가요 – AuK는 텐센트-훈위안이 출시한 15억 파라미터 기초 모델로, 다양한 음성 관련 작업에 활용할 수 있습니다. 자연어 지시를 통해 새로운 음성을 합성하고, 기존 녹음물을 편집하며, 음질을 향상시키고, 음원을 분리할 수 있습니다.

주요 기능

  • 제로샷 TTS – 참조 오디오 클립의 목소리로 음성 생성.
  • 지시 기반 TTS – 참조 없이 텍스트 기반 목소리 설명으로 음성 합성.
  • 콘텐츠 편집 – 말한 단어 교체, 삽입, 삭제 (노래 가사 편집 포함).
  • 음향 편집 – 음높이, 속도, 볼륨 조정.
  • 부언적 편집 – 감정, 음색 변경, 억양 제거, 비언어적 소리 추가/제거, 일반 발화와 속삭임 간 전환.
  • 강화 및 분리 – 노이즈 제거, 리버버베이션 제거, 화자 분리, 음악 보컬 추출, 다수 화자 분리.

모든 작업은 단일한 메시지 기반 API를 공유합니다: 자유 형식의 지시문과 선택적으로 소스/참조 오디오 파일을 제공하면, 모델은 편집 또는 생성된 파형을 반환합니다.

모델 버전

버전 크기 속도 일반적인 사용 사례
AuK (기본) 15억 파라미터 전체 디퓨전 (설정 가능한 스텝 수) 최고 품질의 생성/편집
AuK-Flash 동일한 아키텍처, 증류된 버전 고정 4단계 추론, CFG = 0 실시간 또는 낮은 지연 시나리오

두 모델 모두 Hugging Face와 ModelScope에 호스팅되어 있으며, huggingface_hub 또는 modelscope CLI로 가중치를 다운로드할 수 있습니다.

빠른 시작

  1. 클론 및 설정
    git clone https://github.com/Tencent-Hunyuan/AuK
    cd AuK
    # uv 또는 conda (Python 3.10) 선택
    uv venv --python 3.10 && source .venv/bin/activate
    uv pip install -e "[gradio,train]"   # 핵심 + 선택적 확장 기능 설치
    
  2. 체크포인트 다운로드
    pip install -U "huggingface_hub[cli]"
    hf download tencent/AuK --local-dir ./ckpts/AuK
    hf download tencent/AuK-Flash --local-dir ./ckpts/AuK-Flash
    hf download Qwen/Qwen2.5-Omni-3B --local-dir ./ckpts/Qwen2.5-Omni-3B
    
  3. CLI 예제 실행 (오디오 파일 내 문장 교체)
    auk-infer \
      --audio assets/demo-input-audio/content-edit/content.wav \
      --instruction "'but accepting what we cannot have'을 'and living well with dreams unmet'로 바꿔주세요." \
      --output out.wav \
      --gen_seconds 7.0
    
  4. Gradio 웹 UI 실행 (선택 사항)
    auk-gradio \
      --base_ckpt ckpts/AuK/auk_base.safetensors \
      --flash_ckpt ckpts/AuK-Flash/auk_flash.safetensors \
      --qwen_path ckpts/Qwen2.5-Omni-3B \
      --base_device cuda:0 --flash_device cuda:1 \
      --dtype bf16
    
    UI를 통해 모델을 선택하고 오디오를 업로드하며 지시문을 입력한 후 결과를 들을 수 있습니다.

Python API – 라이브러리는 AukInfer를 제공하며, LLM에서 사용되는 채팅 스타일 형식과 유사한 메시지 사전 리스트를 받아 NumPy 오디오 배열과 샘플 레이트를 반환합니다. README에 콘텐츠 편집 및 지시어만 사용하는 TTS 예제 스크립트가 포함되어 있습니다.

파인튜닝 – 가벼운 학습 스크립트 (src/auk/train/train.py)는 각 항목에 지시어, 선택적 소스 오디오, 타겟 오디오가 포함된 JSONL 파일을 수용합니다. 동적 배치는 타겟 지속 시간에 따라 결정되며, 쉘 래퍼 (scripts/train.sh)도 포함되어 있습니다.

에코시스템 통합

  • ComfyUI 노드 패키지 (comfyui/ComfyUI-AuK) – 시각적 워크플로우 파이프라인용.
  • 프롬프트 엔ハン서 – OpenAI 호환 LLM(예: 텐센트 클라우드 TokenHub)을 사용해 자유 형식 요청을 정확한 auk-infer 명령어로 변환하는 보조 도구.

라이선스 및 인용

  • 코드는 Apache-2.0 라이선스로 배포됩니다 (자세한 내용은 LICENSE 참조).
  • 모델 가중치는 Hugging Face/ModelScope에서 별도의 모델 전용 라이선스 하에 제공됩니다.
  • 인용 형식은 README에 제공되며, 기술 보고서용 BibTeX 항목 포함.

누가 사용할 수 있나요

  • 통합 음성 생성/편집 파이프라인을 탐구하는 연구자.
  • 음성 어시스턴트, 더빙 도구, 오디오 후처리 소프트웨어를 개발하는 개발자.
  • 새로운 녹음을 하지 않고도 빠르게 보이스오버 생성 또는 오디오 정리가 필요한 콘텐츠 제작자.

결론 – AuK는 자연어 인터페이스를 통해 합성, 편집, 강화, 분리를 통합한 진정한 오픈소스 대규모 음성 기초 모델로, 고품질 및 저지연 버전을 모두 제공하며, 즉시 실행 가능한 CLI, 웹 UI, Python API를 갖추고 있습니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트