buxuku/SmartSub
视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.
SmartSub (妙幕) – 자막, 번역, AI 더빙을 위한 통합 데스크톱 도구
기능
- YouTube, B-站 등에서 온라인 링크 또는 비디오 파일을 입력하여 다음의 파이프라인을 실행합니다:
- 다운로드: 원본 비디오와 기존 자막을 가져옵니다.
- 음성 인식 (ASR):
whisper.cpp,faster-whisper, FunASR, Qwen3-ASR, FireRedASR, NVIDIA Parakeet 등의 로컬 모델 또는 클라우드 ASR 서비스(옵션)를 사용합니다. - 번역: 최대 20개의 번역 백엔드(무료 Bing/Google API, Baidu, Azure, DeepL-X, Ollama, Gemini 등)로 생성된 자막을 번역할 수 있습니다. 순수 번역 또는 '원문 + 번역' 양방향 자막을 출력할 수 있습니다.
- 교정: 인터랙티브 에디터에서 자막을 편집하고, AI 보조 기능을 통해 자연스럽게 다듬을 수 있습니다.
- 음성 합성 (TTS) 및 음성 클론: 로컬 모델(Kokoro, VITS, ZipVoice) 또는 클라우드 서비스(Edge TTS, OpenAI 호환, Azure Speech, ElevenLabs 등)로 자막 텍스트를 오디오 트랙으로 변환할 수 있으며, 짧은 참조 클립을 통해 자신의 목소리와 일치시키는 제로샷 클론 기능도 지원합니다.
- 렌더링: 자막을 영상에 하드버닝하거나 소프트 트랙으로 마스킹할 수 있으며, 폰트, 색상, 그림자, 위치 등 완전한 스타일 설정과 실시간 미리보기 기능을 제공합니다.
모든 단계는 독립적으로 실행하거나 체인으로 연결하여 배치 처리가 가능합니다.
왜 중요한가
- 개인정보 우선: 핵심 ASR, 번역(Ollama를 통한), TTS 엔진은 모두 사용자 컴퓨터에서 완전히 실행됩니다. 클라우드 서비스를 명시적으로 활성화하지 않는 한 오디오나 비디오는 컴퓨터 외부로 나가지 않습니다.
- 하드웨어 인식: CPU, NVIDIA CUDA, AMD/Intel Vulkan, Apple Core ML/Metal 가속을 지원합니다. GPU 가속 팩은 앱 자체에 포함되어 있어 CUDA를 별도로 설치할 필요가 없습니다.
- 무료로 실행 가능: 유료 API 키 없이도 완전한 워크플로우가 가능합니다. 로컬 모델은 한 번 다운로드하면 재사용 가능하며, 내장된 무료 번역/TTS 서비스에는 사용 제한이 없습니다.
- 확장성: OpenAI 스타일의 API 엔드포인트를 자체 추가할 수 있으며, UI를 통해 요청 파라미터를 코드 수정 없이 조정할 수 있습니다.
주요 기능 요약
| 기능 | 세부 사항 |
|---|---|
| 비디오 다운로드 | yt-dlp (YouTube + 1800+ 사이트) 또는 lux (중국 플랫폼)로 한 번의 클릭으로 다운로드. 쿠키 처리, 배치 링크, 공식 자막 자동 매칭 지원. |
| ASR 엔진 | 8가지 내장 옵션. 로컬(whisper.cpp, faster-whisper, FunASR, Qwen3-ASR, FireRedASR, NVIDIA Parakeet)과 클라우드 서비스(OpenAI, ElevenLabs Scribe, Deepgram 등)를 혼용 가능. |
| AI 자막 보정 | Ollama를 통한 로컬 LLM으로 의미적 재분할 + 일괄 수정(구두점, 동음이의어, 필러 제거). |
| 번역 | 20개의 제공업체 지원. 무료 Bing/Google, 중국 클라우드 업체, 대규모 모델 API(Gemini, DeepSeek, Azure OpenAI 등). 사용자 정의 파라미터 JSON 지원. |
| 교정 UI | 비디오와 자막을 양측에 표시. 되돌리기/다시하기, 라인 단위 삭제/복원, 한 번의 클릭으로 AI 재작성. |
| TTS 및 음성 클론 | 로컬: Kokoro(103개 음성), VITS(174개 중국어 음성) – 무료, 오프라인. ZipVoice로 짧은 참조 클립으로 제로샷 클론 가능. 클라우드 옵션: Edge TTS, OpenAI, Azure, ElevenLabs 등. |
| 자막 렌더링 | 하드버닝(영구적) 또는 소프트마스크(전환 가능)로 완전한 스타일 에디터와 실시간 미리보기 지원. |
| 크로스플랫폼 | Windows x64, macOS (Apple Silicon & Intel), Linux x64. GitHub 릴리스 또는 Homebrew(brew install --cask smartsub)로 설치 가능. |
| GPU 가속 | CUDA, Vulkan, Core ML 팩을 자동 감지 및 다운로드. 필요 시 CPU로 포워드. |
일반적인 사용 사례
- 학습 – 외국어 강의나 튜토리얼에 양국어 자막 추가.
- 콘텐츠 제작자 – 제3자 서비스 요금 없이 YouTube 또는 B-站 동영상의 자막과 더빙 오디오 생성.
- 팟캐스트/회의 기록 – 음성 파일을 일괄 트랜스크립트하여 검색 가능한 SRT 파일로 변환.
- 개인용 더빙 – 자신의 목소리를 클론하여 동영상을 완전히 내레이션된 버전으로 제작.
시작하기
- OS에 맞는 설치 파일을 다운로드 (GPU 팩은 선택 사항).
- 앱을 실행하고, 음성 모델을 가져오거나 클라우드 ASR을 설정하기 위해 온보딩 마법사를 따라갑니다.
- 비디오를 드래그 앤 드롭하거나 URL을 붙여넣고, 원본/대상 언어를 설정한 후 Start를 누릅니다. 음성 인식 후 편집, 번역, TTS 합성 후 최종 동영상을 내보냅니다.
커뮤니티 및 기여
- MIT 라이선스 하에 오픈소스. 이슈 및 풀 리퀘스트를 통한 기여를 환영합니다.
yarn install및yarn dev로 로컬 빌드. 네이티브 종속성(whisper addon, sherpa-onnx)은 자동으로 다운로드됩니다.- README에 스폰서십 옵션(DigitalOcean, Alipay/WeChat 기부, QQ 그룹)이 기재되어 있습니다.
결론: SmartSub는 단일 크로스플랫폼 데스크톱 애플리케이션을 통해 어떤 비디오도 자막, 번역, 더빙된 제품으로 변환할 수 있는 완전한 프라이버시 보호형 AI 워크플로우를 제공합니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트