buxuku/SmartSub

视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.

SmartSub (妙幕) – 一站式桌面工具,用於字幕、翻譯與AI配音

功能

  • 接收影片(或來自YouTube、B站等的線上連結),執行完整工作流程:
    1. 下載:取得原始影片與任何現有字幕。
    2. 語音轉文字(ASR):使用本地模型如 whisper.cppfaster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet,或可選的雲端ASR服務。
    3. 翻譯:透過最多20個翻譯後端(免費Bing/Google API、百度、Azure、DeepL-X、Ollama、Gemini等)翻譯生成的字幕——可輸出純翻譯或「原文+翻譯」的雙語字幕。
    4. 校對:在互動式編輯器中編輯字幕,支援可選的AI輔助潤飾。
    5. 文字轉語音(TTS)與語音克隆:使用本地模型(Kokoro、VITS、ZipVoice)或雲端服務(Edge TTS、OpenAI相容、Azure Speech、ElevenLabs等)將字幕文字轉為音訊軌道,可選地透過零樣本克隆匹配您自己的聲音。
    6. 渲染:將最終影片硬燒錄字幕至畫面中或以軟字幕軌道方式複用,支援完整樣式(字型、顏色、陰影、位置)與即時預覽。

所有步驟可獨立運行或串聯成批次處理流程。

為何重要

  • 隱私優先:核心ASR、翻譯(透過Ollama)與TTS引擎完全在使用者裝置上執行;除非您明確啟用雲端服務,否則音訊或影片不會離開電腦。
  • 硬體感知:支援CPU、NVIDIA CUDA、AMD/Intel Vulkan以及Apple Core ML/Metal加速。應用程式內建GPU加速套件,無需自行安裝CUDA。
  • 免費運行:無需任何付費API金鑰即可實現完整工作流程——本地模型僅需下載一次,內建免費翻譯/TTS服務無使用限制。
  • 可擴充:可新增自己的OpenAI風格API端點用於翻譯、ASR或TTS,UI允許您無需修改程式碼即可調整請求參數。

主要功能一覽

功能 詳細
影片下載 透過 yt-dlp(YouTube + 1800+ 站點)或 lux(中文平台)一鍵下載,支援Cookie、批次連結與自動匹配官方字幕。
ASR引擎 8種內建選項,混合本地(whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet)與雲端服務(OpenAI、ElevenLabs Scribe、Deepgram等)。
AI字幕潤飾 透過Ollama呼叫本地LLM實現語義重分段+批量修正(標點、同音詞、填充詞去除)。
翻譯 20個提供者,免費Bing/Google、中文雲端廠商、大模型API(Gemini、DeepSeek、Azure OpenAI等),支援自訂參數JSON。
校對UI 影片與字幕並排顯示,支援撤銷/重做、逐行刪除/復原、一鍵AI重寫。
TTS與語音克隆 本地Kokoro(103種聲音)與VITS(174種中文聲音)——免費、離線。ZipVoice支援從短參考片段實現零樣本克隆。雲端選項包括Edge TTS、OpenAI、Azure、ElevenLabs等。
字幕渲染 硬燒錄(永久)或軟複用(可切換),支援完整樣式編輯器與即時預覽。
跨平台 Windows x64、macOS(Apple Silicon & Intel)、Linux x64。可透過GitHub發布版或Homebrew(brew install --cask smartsub)安裝。
GPU加速 自動偵測並下載CUDA、Vulkan或Core ML套件;必要時可回退至CPU。

典型使用情境

  • 學習 – 為外語講座或教學影片添加雙語字幕。
  • 內容創作者 – 無需支付第三方服務費用,為YouTube或B站影片生成字幕與配音音訊。
  • 播客/會議歸檔 – 批次轉錄音訊檔案為可搜尋的SRT檔案。
  • 個人語音配音 – 克隆自己的聲音,製作影片的完整旁白版本。

快速上手

  1. 下載適用於您作業系統的安裝包(GPU套件為可選)。
  2. 運行應用程式,依照引導向導取得語音模型(或設定雲端ASR)。
  3. 拖曳影片或貼上URL,設定來源語言/目標語言,點擊 開始。轉錄完成後可編輯、翻譯、TTS合成,最終匯出完成的影片。

社群與貢獻

  • 以MIT授權開源,歡迎透過Issue與Pull Request參與貢獻。
  • 本地建置使用 yarn installyarn dev;原生相依性(whisper addon、sherpa-onnx)會自動取得。
  • README中列出了贊助選項(DigitalOcean、支付寶/微信捐款、QQ群)。

總結:SmartSub將完整的、保護隱私的AI工作流程打包為單一跨平台桌面應用,可將任意影片轉化為帶字幕、翻譯與配音的產品。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案