ASLP-lab/MeanVC
A Lightweight and Streaming Zero-Shot Voice Conversion via Mean Flows
What it solves
MeanVC 解决了在实时环境下进行高保真、零样本语音转换(在保持说话内容不变的同时改变说话者的音色)的挑战。其目标是减少通常与基于扩散模型的语音转换相关的计算开销和延迟,使其足够轻量,能够用于流式应用。
How it works
该系统使用扩散 Transformer 与分块自回归去噪策略相结合,以流式方式处理音频。为了实现快速生成,它采用了“mean flows”,允许模型在单个步骤中将起点映射到终点,从而绕过了多次迭代去噪步骤的需求。它可以将源语音转换为任何目标语音,而无需针对特定说话者进行重新训练(零样本)。
Who it’s for
该工具专为从事语音合成、实时音频处理以及需要低延迟和高说话者相似度的语音克隆应用的研发人员和开发者设计。
Highlights
- Streaming Inference: 支持通过麦克风输入进行实时转换,采用分块处理方式。
- Single-Step Generation: 与传统的扩散模型相比,使用 mean flows 实现快速推理。
- Zero-Shot Capability: 无需额外训练即可将音色转移到未见过的目标说话者。
- Lightweight Architecture: 与之前的方法相比,使用了显著更少的参数,同时保持了高语音质量。
相关
- 项目
- 项目
- 项目
- 项目
- 项目