buxuku/SmartSub

视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.

SmartSub (妙幕) – 자막, 번역, AI 더빙을 위한 통합 데스크톱 도구

기능

  • YouTube, B-站 등에서 온라인 링크 또는 비디오 파일을 입력하여 다음의 파이프라인을 실행합니다:
    1. 다운로드: 원본 비디오와 기존 자막을 가져옵니다.
    2. 음성 인식 (ASR): whisper.cpp, faster-whisper, FunASR, Qwen3-ASR, FireRedASR, NVIDIA Parakeet 등의 로컬 모델 또는 클라우드 ASR 서비스(옵션)를 사용합니다.
    3. 번역: 최대 20개의 번역 백엔드(무료 Bing/Google API, Baidu, Azure, DeepL-X, Ollama, Gemini 등)로 생성된 자막을 번역할 수 있습니다. 순수 번역 또는 '원문 + 번역' 양방향 자막을 출력할 수 있습니다.
    4. 교정: 인터랙티브 에디터에서 자막을 편집하고, AI 보조 기능을 통해 자연스럽게 다듬을 수 있습니다.
    5. 음성 합성 (TTS) 및 음성 클론: 로컬 모델(Kokoro, VITS, ZipVoice) 또는 클라우드 서비스(Edge TTS, OpenAI 호환, Azure Speech, ElevenLabs 등)로 자막 텍스트를 오디오 트랙으로 변환할 수 있으며, 짧은 참조 클립을 통해 자신의 목소리와 일치시키는 제로샷 클론 기능도 지원합니다.
    6. 렌더링: 자막을 영상에 하드버닝하거나 소프트 트랙으로 마스킹할 수 있으며, 폰트, 색상, 그림자, 위치 등 완전한 스타일 설정과 실시간 미리보기 기능을 제공합니다.

모든 단계는 독립적으로 실행하거나 체인으로 연결하여 배치 처리가 가능합니다.

왜 중요한가

  • 개인정보 우선: 핵심 ASR, 번역(Ollama를 통한), TTS 엔진은 모두 사용자 컴퓨터에서 완전히 실행됩니다. 클라우드 서비스를 명시적으로 활성화하지 않는 한 오디오나 비디오는 컴퓨터 외부로 나가지 않습니다.
  • 하드웨어 인식: CPU, NVIDIA CUDA, AMD/Intel Vulkan, Apple Core ML/Metal 가속을 지원합니다. GPU 가속 팩은 앱 자체에 포함되어 있어 CUDA를 별도로 설치할 필요가 없습니다.
  • 무료로 실행 가능: 유료 API 키 없이도 완전한 워크플로우가 가능합니다. 로컬 모델은 한 번 다운로드하면 재사용 가능하며, 내장된 무료 번역/TTS 서비스에는 사용 제한이 없습니다.
  • 확장성: OpenAI 스타일의 API 엔드포인트를 자체 추가할 수 있으며, UI를 통해 요청 파라미터를 코드 수정 없이 조정할 수 있습니다.

주요 기능 요약

기능 세부 사항
비디오 다운로드 yt-dlp (YouTube + 1800+ 사이트) 또는 lux (중국 플랫폼)로 한 번의 클릭으로 다운로드. 쿠키 처리, 배치 링크, 공식 자막 자동 매칭 지원.
ASR 엔진 8가지 내장 옵션. 로컬(whisper.cpp, faster-whisper, FunASR, Qwen3-ASR, FireRedASR, NVIDIA Parakeet)과 클라우드 서비스(OpenAI, ElevenLabs Scribe, Deepgram 등)를 혼용 가능.
AI 자막 보정 Ollama를 통한 로컬 LLM으로 의미적 재분할 + 일괄 수정(구두점, 동음이의어, 필러 제거).
번역 20개의 제공업체 지원. 무료 Bing/Google, 중국 클라우드 업체, 대규모 모델 API(Gemini, DeepSeek, Azure OpenAI 등). 사용자 정의 파라미터 JSON 지원.
교정 UI 비디오와 자막을 양측에 표시. 되돌리기/다시하기, 라인 단위 삭제/복원, 한 번의 클릭으로 AI 재작성.
TTS 및 음성 클론 로컬: Kokoro(103개 음성), VITS(174개 중국어 음성) – 무료, 오프라인. ZipVoice로 짧은 참조 클립으로 제로샷 클론 가능. 클라우드 옵션: Edge TTS, OpenAI, Azure, ElevenLabs 등.
자막 렌더링 하드버닝(영구적) 또는 소프트마스크(전환 가능)로 완전한 스타일 에디터와 실시간 미리보기 지원.
크로스플랫폼 Windows x64, macOS (Apple Silicon & Intel), Linux x64. GitHub 릴리스 또는 Homebrew(brew install --cask smartsub)로 설치 가능.
GPU 가속 CUDA, Vulkan, Core ML 팩을 자동 감지 및 다운로드. 필요 시 CPU로 포워드.

일반적인 사용 사례

  • 학습 – 외국어 강의나 튜토리얼에 양국어 자막 추가.
  • 콘텐츠 제작자 – 제3자 서비스 요금 없이 YouTube 또는 B-站 동영상의 자막과 더빙 오디오 생성.
  • 팟캐스트/회의 기록 – 음성 파일을 일괄 트랜스크립트하여 검색 가능한 SRT 파일로 변환.
  • 개인용 더빙 – 자신의 목소리를 클론하여 동영상을 완전히 내레이션된 버전으로 제작.

시작하기

  1. OS에 맞는 설치 파일을 다운로드 (GPU 팩은 선택 사항).
  2. 앱을 실행하고, 음성 모델을 가져오거나 클라우드 ASR을 설정하기 위해 온보딩 마법사를 따라갑니다.
  3. 비디오를 드래그 앤 드롭하거나 URL을 붙여넣고, 원본/대상 언어를 설정한 후 Start를 누릅니다. 음성 인식 후 편집, 번역, TTS 합성 후 최종 동영상을 내보냅니다.

커뮤니티 및 기여

  • MIT 라이선스 하에 오픈소스. 이슈 및 풀 리퀘스트를 통한 기여를 환영합니다.
  • yarn installyarn dev로 로컬 빌드. 네이티브 종속성(whisper addon, sherpa-onnx)은 자동으로 다운로드됩니다.
  • README에 스폰서십 옵션(DigitalOcean, Alipay/WeChat 기부, QQ 그룹)이 기재되어 있습니다.

결론: SmartSub는 단일 크로스플랫폼 데스크톱 애플리케이션을 통해 어떤 비디오도 자막, 번역, 더빙된 제품으로 변환할 수 있는 완전한 프라이버시 보호형 AI 워크플로우를 제공합니다.

관련

  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트
  • 프로젝트