ASLP-lab/MeanVC

A Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows

What it solves

MeanVC는 실시간으로 고충실도 제로샷 음성 변환(말하는 내용은 유지하면서 화자의 목소리 음색을 바꾸는 것)의 과제를 해결합니다. 이는 확산 기반 음성 변환에서 일반적으로 발생하는 계산 오버헤드와 지연 시간을 줄여 스트리밍 애플리케이션에 적합할 만큼 가볍게 만드는 것을 목표로 합니다.

How it works

이 시스템은 스트림 방식으로 오디오를 처리하기 위해 확산 트랜스포머(diffusion transformer)와 청크 단위의 자기회귀적 노이즈 제거(chunk-wise autoregressive denoising) 전략을 결합하여 사용합니다. 빠른 생성을 위해, 모델이 여러 번의 반복적인 노이즈 제거 단계를 거칠 필요 없이 시작점에서 끝점으로 한 번에 매핑할 수 있도록 하는 "mean flows"를 채택합니다. 특정 화자에 대해 재학습할 필요 없이 소스 음성을 어떤 타겟 음성으로든 변환할 수 있습니다(zero-shot).

Who it’s for

이 도구는 낮은 지연 시간과 높은 화자 유사성이 요구되는 음성 합성, 실시간 오디오 처리 및 음성 복제 애플리케이션을 연구하는 연구자 및 개발자를 위해 설계되었습니다.

Highlights

  • Streaming Inference: 청크 단위 처리를 사용하여 마이크 입력을 통한 실시간 변환을 지원합니다.
  • Single-Step Generation: 전통적인 확산 모델에 비해 빠른 추론을 위해 mean flows를 사용합니다.
  • Zero-Shot Capability: 추가 학습 없이 보지 못한 타겟 화자에게 음색을 전달합니다.
  • Lightweight Architecture: 높은 음성 품질을 유지하면서 이전 방법보다 훨씬 적은 매개변수를 사용합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트