HAKORADev/VODER

Voice Operation and Design Engine with Reproduction capabilities

解决的问题

VODER 将专业级语音处理能力带入您的本地机器,完全免费且离线运行。它通过将 8 个核心音频模式——语音转文字(STT)、文字转语音(TTS)、语音转换(VC)、音乐生成、语音增强、音效、人声分离和说话人分离——整合到一个命令行界面中,消除了对多个独立工具或云服务订阅的需求。它还通过说话人分离、配音和任意语言间翻译等功能,解决了处理杂乱多说话人录音、噪声音频或语言障碍的痛点。

如何工作

VODER 通过单一 CLI 协调一系列开源 AI 模型。您只需调用一个命令,如 python voder.py ttsstt,系统便会将请求路由到相应的模型:Whisper 用于语音识别,Qwen3-TTS 和 Fish Audio S2-Pro 用于语音合成与克隆,Seed-VC 用于语音转换,ACE-Step 用于音乐生成,TangoFlux 用于音效,UniSE 用于增强,pyannote 用于说话人分离。它还具备智能输入管道,可接收来自 YouTube、TikTok 等平台的 URL,验证其指向视频内容,并自动下载。除了 8 个核心模式外,三个任务层进一步提升实用性:train 可将可重复使用的语音克隆保存为 .tts/.ttse 文件;quest 提供轻量级辅助任务,如 URL 下载和音频操作;chains 允许您将多个任务串联成自定义流水线(例如:生成音乐 → 分离人声 → 训练语音 → 配音视频)。一个独立的 Project Eva DLC 插件则通过 Flux 2 Dev 和 MiniMax H3 等模型,扩展支持文本生成图像、文本生成视频(含音频)、视频编辑、3D 场景生成以及本地聊天(VADAR),每个功能均在独立环境中运行。

适用人群

VODER 适用于内容创作者、播客制作者、视频编辑者、音乐人、配音演员,以及任何需要专业音频处理但不愿承担云服务成本或牺牲隐私的用户。它既适合 CLI 用户,也支持 GUI(可用)。由于所有模式均可在 CPU 上运行,即使没有专用 GPU 也能使用,但配备 GPU 可显著提升处理速度。

主要亮点

  • 一个工具内集成 8 个核心处理模式:TTS、STS(语音转换)、TTM(音乐)、STT(转录)、SE(增强)、SFX(音效)、SVS(人声分离)、SS(说话人分离)。
  • 支持多说话人对话系统,可通过脚本指令控制每行的时长、音量和持续时间,支持嵌入音效和自动背景音乐。
  • 语音设计与克隆:用自然语言描述语音特征,或从参考音频中克隆语音,可在同一对话中混合使用。
  • 语言转换与配音:在保留原始说话人声音的同时翻译语音,并为视频实现逐段时间对齐。
  • 智能输入管道:粘贴 YouTube、TikTok、Bilibili、Snapchat、Instagram、Facebook 或 X/Twitter 的 URL,或上传图片进行 OCR。
  • 任务层:train 将可复用的语音克隆保存为 .tts/.ttse 文件;quest 提供媒体操作工具;chains 可组合自定义流水线。
  • Project Eva DLC 扩展支持文本生成图像、文本生成视频(含音频)、视频编辑、3D 场景生成,以及无限制本地聊天(VADAR)——全部通过相同的 CLI 模式调用。
  • 完全离线运行,支持 CPU 或 GPU,仅需 FFmpeg 作为外部依赖。

相关

  • 项目
  • 项目
  • 项目
  • 项目