HAKORADev/VODER
Voice Operation and Design Engine with Reproduction capabilities
解決的問題
VODER 將專業級語音處理能力帶入您的本地機器,完全免費且離線運行。它透過整合 8 種核心音訊模式——語音轉文字(STT)、文字轉語音(TTS)、語音轉換(VC)、音樂生成、語音增強、音效、人聲分離與說話人分離——於單一命令列介面中,消除對多個獨立工具或雲端訂閱的需求。同時,透過說話人分離、配音與任意語言間翻譯等功能,解決處理雜亂多說話人錄音、雜訊音訊或語言障礙的痛點。
如何運作
VODER 透過單一 CLI 協調一系列開源 AI 模型。您只需呼叫一個命令,如 python voder.py tts 或 stt,系統便會將請求路由至對應模型:Whisper 用於語音辨識,Qwen3-TTS 與 Fish Audio S2-Pro 用於語音合成與克隆,Seed-VC 用於語音轉換,ACE-Step 用於音樂生成,TangoFlux 用於音效,UniSE 用於增強,pyannote 用於說話人分離。它還具備智慧輸入管道,可接收來自 YouTube、TikTok 等平台的 URL,驗證其指向影片內容,並自動下載。除了 8 種核心模式外,三個任務層進一步提升實用性:train 可將可重複使用的語音克隆儲存為 .tts/.ttse 檔案;quest 提供輕量級輔助任務,如 URL 下載與音訊操作;chains 允許您將多個任務串聯成自訂流程(例如:生成音樂 → 分離人聲 → 訓練語音 → 配音影片)。一個獨立的 Project Eva DLC 插件則透過 Flux 2 Dev 與 MiniMax H3 等模型,擴展支援文字生成影像、文字生成影片(含音訊)、影片編輯、3D 場景生成,以及本地聊天(VADAR),每個功能均在獨立環境中執行。
適用對象
VODER 適用於內容創作者、播客製作者、影片編輯者、音樂人、配音員,以及任何需要專業音訊處理但不願承擔雲端成本或犧牲隱私的使用者。它既適合 CLI 使用者,也支援 GUI(可用)。由於所有模式皆可在 CPU 上運行,即使沒有專用 GPU 也能使用,但配備 GPU 可顯著提升處理速度。
主要亮點
- 一個工具內整合 8 種核心處理模式:TTS、STS(語音轉換)、TTM(音樂)、STT(轉錄)、SE(增強)、SFX(音效)、SVS(人聲分離)、SS(說話人分離)。
- 支援多說話人對話系統,可透過腳本指令控制每行的時長、音量與持續時間,支援嵌入音效與自動背景音樂。
- 語音設計與克隆:以自然語言描述語音特徵,或從參考音訊中克隆語音,可在同一對話中混合使用。
- 語言轉換與配音:在保留原始說話人聲音的同時翻譯語音,並為影片實現逐段時間對齊。
- 智慧輸入管道:貼上 YouTube、TikTok、Bilibili、Snapchat、Instagram、Facebook 或 X/Twitter 的 URL,或上傳圖片進行 OCR。
- 任務層:
train將可重複使用的語音克隆儲存為 .tts/.ttse 檔案;quest提供媒體操作工具;chains可組合自訂流程。 - Project Eva DLC 擴展支援文字生成影像、文字生成影片(含音訊)、影片編輯、3D 場景生成,以及無限制本地聊天(VADAR)——全部透過相同的 CLI 模式呼叫。
- 完全離線運行,支援 CPU 或 GPU,僅需 FFmpeg 作為外部相依。
相關
- 專案
- 專案
- 專案
- 專案