buxuku/SmartSub

视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.

解决的问题

SmartSub 为视频处理提供了一套完整的自动化流水线,解决了语音转文字、字幕翻译和生成 AI 配音等碎片化工作流的问题。它使用户无需使用多个互不关联的工具,即可将外语视频转换为带有同步配音和内嵌字幕的本地化内容。

工作原理

该应用程序作为一个多步骤流水线运行:它下载视频(通过 yt-dlp/lux),使用本地引擎(如 whisper.cpp 或 FunASR)进行音频转录,使用各种服务(包括通过 Ollama 使用本地 LLM)进行文本翻译,并执行 TTS(文本转语音)进行配音。最后,它使用 FFmpeg 将字幕压制到视频中或将其作为软字幕封装。

适用人群

  • 内容创作者:希望为国际观众实现视频本地化的创作者。
  • 语言学习者:需要外语讲座或视频双语字幕的学习者。
  • 播客/会议组织者:需要将音频批量转录为 SRT 文件的组织者。
  • 注重隐私的用户:希望在自己的硬件上本地运行转录和 TTS 模型的用户。

亮点

  • 全流程覆盖:涵盖下载、转录、翻译、校对、配音和视频合成。
  • 本地优先的隐私保护:支持使用本地模型(Whisper, Kokoro, VITS)进行离线处理,确保文件保留在用户机器上。
  • 硬件加速:支持 NVIDIA CUDA、AMD/Intel Vulkan 和 Apple Silicon (Core ML/Metal)。
  • 广泛的集成:连接 20 多种翻译服务和各种云端 ASR/TTS 提供商。
  • 声音克隆:具备使用本地或云端引擎的零样本(zero-shot)声音克隆功能。