buxuku/SmartSub
视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.
SmartSub (妙幕) – 一站式桌面工具,用于字幕、翻译和AI配音
功能
- 接收视频(或来自YouTube、B站等的在线链接),运行完整工作流:
- 下载:获取源视频和任何现有字幕。
- 语音转文字(ASR):使用本地模型如
whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet,或可选的云ASR服务。 - 翻译:通过最多20个翻译后端(免费Bing/Google API、百度、Azure、DeepL-X、Ollama、Gemini等)翻译生成的字幕——可输出纯翻译或“原文+翻译”的双语字幕。
- 校对:在交互式编辑器中编辑字幕,支持可选的AI辅助润色。
- 文本转语音(TTS)和语音克隆:使用本地模型(Kokoro、VITS、ZipVoice)或云服务(Edge TTS、OpenAI兼容、Azure Speech、ElevenLabs等)将字幕文本转为音频轨道,可选地通过零样本克隆匹配您自己的声音。
- 渲染:将最终视频硬烧录字幕到画面中或以软字幕轨道方式复用,支持完整样式(字体、颜色、阴影、位置)和实时预览。
所有步骤可独立运行或串联成批处理流程。
为何重要
- 隐私优先:核心ASR、翻译(通过Ollama)和TTS引擎完全在用户设备上运行;除非您明确启用云服务,否则音频或视频不会离开计算机。
- 硬件感知:支持CPU、NVIDIA CUDA、AMD/Intel Vulkan以及Apple Core ML/Metal加速。应用自带GPU加速包,无需自行安装CUDA。
- 免费运行:无需任何付费API密钥即可实现完整工作流——本地模型仅需下载一次,内置免费翻译/TTS服务无使用限制。
- 可扩展:可添加自己的OpenAI风格API端点用于翻译、ASR或TTS,UI允许您无需修改代码即可调整请求参数。
主要功能一览
| 功能 | 详情 |
|---|---|
| 视频下载 | 通过 yt-dlp(YouTube + 1800+ 站点)或 lux(中文平台)一键下载,支持Cookie、批量链接和自动匹配官方字幕。 |
| ASR引擎 | 8种内置选项,混合本地(whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet)和云服务(OpenAI、ElevenLabs Scribe、Deepgram等)。 |
| AI字幕润色 | 通过Ollama调用本地LLM实现语义重分段 + 批量修正(标点、同音词、填充词去除)。 |
| 翻译 | 20个提供方,免费Bing/Google、中文云厂商、大模型API(Gemini、DeepSeek、Azure OpenAI等),支持自定义参数JSON。 |
| 校对UI | 视频与字幕并排显示,支持撤销/重做、逐行删除/恢复、一键AI重写。 |
| TTS与语音克隆 | 本地Kokoro(103种声音)与VITS(174种中文声音)——免费、离线。ZipVoice支持从短参考片段实现零样本克隆。云选项包括Edge TTS、OpenAI、Azure、ElevenLabs等。 |
| 字幕渲染 | 硬烧录(永久)或软复用(可切换),支持完整样式编辑器和实时预览。 |
| 跨平台 | Windows x64、macOS(Apple Silicon & Intel)、Linux x64。可通过GitHub发布版或Homebrew(brew install --cask smartsub)安装。 |
| GPU加速 | 自动检测并下载CUDA、Vulkan或Core ML包;必要时可回退至CPU。 |
典型使用场景
- 学习 – 为外语讲座或教程添加双语字幕。
- 内容创作者 – 无需支付第三方服务费用,为YouTube或B站视频生成字幕和配音音频。
- 播客/会议归档 – 批量转录音频文件为可搜索的SRT文件。
- 个人语音配音 – 克隆自己的声音,制作视频的完整旁白版本。
快速上手
- 下载适用于您操作系统的安装包(GPU包为可选)。
- 运行应用,按照引导向导获取语音模型(或配置云ASR)。
- 拖拽视频或粘贴URL,设置源语言/目标语言,点击 开始。转录完成后可编辑、翻译、TTS合成,最终导出完成的视频。
社区与贡献
- 采用MIT许可证开源,欢迎通过Issue和Pull Request参与贡献。
- 本地构建使用
yarn install和yarn dev;原生依赖(whisper addon、sherpa-onnx)会自动获取。 - README中列出了赞助选项(DigitalOcean、支付宝/微信捐赠、QQ群)。
总结:SmartSub将完整的、保护隐私的AI工作流打包为单一跨平台桌面应用,可将任意视频转化为带字幕、翻译和配音的产品。
相关
- 项目
- 项目
- 项目
- 项目
- 项目