gemelo-ai/vocos
Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis
解决的问题
Vocos 是一种神经声码器,旨在从声学特征(如梅尔频谱图或 EnCodec 令牌)中合成高质量的音频波形。它旨在弥合时域与基于傅里叶变换的神经声码器之间的差距,提供快速且高保真的音频重建。
工作原理
与传统基于 GAN 的声码器在时域中建模音频样本不同,Vocos 生成的是频谱系数。这些系数随后通过逆傅里叶变换转换为音频波形,使模型能够在单次前向传播中生成音频,实现快速重建。
适用人群
本工具适用于构建音频合成系统、文本转语音(TTS)流程的研究人员和开发者,或希望与其他音频模型(如 Bark)集成的用户。
主要亮点
- 快速合成:单次前向传播即可生成波形。
- 频谱域建模:使用频谱系数和逆傅里叶变换,而非时域建模。
- 基于 GAN 的训练:使用生成对抗网络(GAN)目标函数进行训练。
- 灵活输入:支持从梅尔频谱图和 EnCodec 令牌中进行重建。
相关
- 项目
- 项目
RchGrav/claudeboxClaudeBox 是一个基于 Docker 的工具,可在隔离的容器中启动 Anthropic 的 Claude Code AI 编码助手。它提供项目专属的 Docker 镜像、持久化验证/历史记录,以及一组预先配置的开发配置文件(C/C++、Python、Rust、Go 等)。功能包括多实例支持、防火墙白名单、macOS 剪贴板桥接、tmux 集成以及简单的任务引擎。安装方式为自解压的 .run 安装程序,若有需要也会自动配置 Docker。用户可为每个项目创建“插槽”(持久化的 Claude 会话)、添加配置文件,并以自定义标志运行 Claude,同时保持项目数据的隔离性与可重现性。
- 项目
Tencent-Hunyuan/AuKAuK 是一个 15 亿参数的开源基础模型,用于语音生成、编辑、增强和源分离。它通过自然语言指令工作,提供高质量基础模型和快速 4 步蒸馏版“快闪”版本,并支持 CLI、Gradio UI、Python API、微调脚本和 ComfyUI 集成。
- 项目
Spielewoy/autoprompt-skillAutoprompt-Skill 是一个基于 Node 的 CLI,它封装了多个 LLM 编码代理(如 Claude、Codex、OpenCode 等),以自动化“编写-测试-审查”循环。通过 npm 安装,选择一个提供者,并运行 `autoprompt activate PROVIDER -- "<goal>"`(可选配 `path=` 和并发标志)。在 Terminal-Bench 2.1 上的基准测试显示,失败率降低了 45%(73/89 次解决,原为 60/89),代价是更高的执行时间和 Token 使用量。