ASLP-lab/MeanVC
A Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
What it solves
MeanVCは、高忠実度かつゼロショットの音声変換(話された言葉を維持しながら話者の声の音色を変更すること)をリアルタイムで行うという課題に対処します。拡散ベースの音声変換に通常伴う計算オーバーヘッドとレイテンシを削減することを目指しており、ストリーミングアプリケーションに適した軽量な設計となっています。
How it works
このシステムは、拡散トランスフォーマー(diffusion transformer)とチャンク単位の自己回帰的なデノイジング戦略を組み合わせ、オーディオをストリームとして処理します。高速な生成を実現するために、「mean flows」を採用しており、これによりモデルは開始点から終了点までを単一のステップでマッピングでき、複数の反復的なデノイジングステップを必要としません。特定の話者に対して再学習を行うことなく、ソース音声を任意のターゲット音声に変換できます(ゼロショット)。
Who it’s for
このツールは、音声合成、リアルタイムオーディオ処理、および低レイテンシと高い話者類似性が求められるボイスクローニングアプリケーションに従事する研究者や開発者向けに設計されています。
Highlights
- Streaming Inference: マイク入力によるチャンク単位の処理を用いたリアルタイム変換をサポートします。
- Single-Step Generation: 従来の拡散モデルと比較して、高速な推論を実現するためにmean flowsを使用します。
- Zero-Shot Capability: 追加のトレーニングなしで、未知のターゲット話者の音色を転送します。
- Lightweight Architecture: 高い音声品質を維持しながら、以前の手法よりも大幅に少ないパラメータ数を使用します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト