gemelo-ai/vocos
Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis
解決的問題
Vocos 是一種神經聲碼器,旨在從聲學特徵(例如梅爾頻譜圖或 EnCodec 標記)中合成高品質的音訊波形。它旨在彌補時域與基於傅立葉變換的神經聲碼器之間的差距,提供快速且高保真的音訊重建。
工作原理
與傳統基於 GAN 的聲碼器在時域中建模音訊樣本不同,Vocos 生成的是頻譜係數。這些係數隨後透過逆傅立葉變換轉換為音訊波形,使模型能在單次前向傳播中生成音訊,實現快速重建。
適用對象
本工具適用於建構音訊合成系統、文字轉語音(TTS)流程的研究人員與開發者,或希望與其他音訊模型(如 Bark)整合的使用者。
主要亮點
- 快速合成:單次前向傳播即可生成波形。
- 頻譜域建模:使用頻譜係數與逆傅立葉變換,而非時域建模。
- 基於 GAN 的訓練:使用生成對抗網路(GAN)目標函數進行訓練。
- 靈活輸入:支援從梅爾頻譜圖與 EnCodec 標記中進行重建。
相關
- 專案
- 專案
RchGrav/claudeboxClaudeBox 是一個基於 Docker 的工具,可在隔離的容器中啟動 Anthropic 的 Claude Code AI 編碼助手。它提供專案專屬的 Docker 映像檔、持久化驗證/歷史記錄,以及一組預先配置的開發設定檔(C/C++、Python、Rust、Go 等)。功能包括多實例支援、防火牆白名單、macOS 剪貼簿橋接、tmux 整合以及簡單的任務引擎。安裝方式為自解壓縮的 .run 安裝程式,若有需要也會自動設定 Docker。使用者可為每個專案建立「插槽」(持久化的 Claude 工作階段)、新增設定檔,並以自訂旗標執行 Claude,同時保持專案資料的隔離性與可重現性。
- 專案
Tencent-Hunyuan/AuKAuK 是一個 15 億參數的開源基礎模型,適用於語音生成、編輯、增強與來源分離。它透過自然語言指令運作,提供高品質基礎模型與快速 4 步蒸餾版「快閃」版本,並支援 CLI、Gradio UI、Python API、微調腳本與 ComfyUI 集成。
- 專案
Spielewoy/autoprompt-skillAutoprompt-Skill 是一個基於 Node 的 CLI,它封裝了多個 LLM 編碼代理(如 Claude、Codex、OpenCode 等),以自動化「編寫-測試-審查」的循環。透過 npm 安裝,選擇一個提供者,並執行 `autoprompt activate PROVIDER -- "<goal>"`(可選配 `path=` 和並發標誌)。在 Terminal-Bench 2.1 上的基準測試顯示,失敗率降低了 45%(73/89 次解決,原為 60/89),代價是更高的執行時間和 Token 使用量。