buxuku/SmartSub

视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.

SmartSub (妙幕) – サブタイトル、翻訳、AIダブリングのワンストップデスクトップツール

機能概要

  • YouTube、B‐站などのオンラインリンクまたは動画ファイルを入力し、以下のパイプラインを実行します:
    1. ダウンロード:元の動画と既存の字幕を取得。
    2. 音声認識(ASR)whisper.cppfaster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeetなどのローカルモデル、またはクラウドASRサービス(オプション)を使用。
    3. 翻訳:最大20の翻訳バックエンド(無料のBing/Google API、Baidu、Azure、DeepL-X、Ollama、Geminiなど)で生成された字幕を翻訳可能。純粋な翻訳または「原文+翻訳」のバイリンガル字幕を出力可。
    4. 校正:インタラクティブエディタで字幕を編集・校正可能。AI補助による自然な文章修正も可能。
    5. 音声合成(TTS)とボイスクラッキング:ローカルモデル(Kokoro、VITS、ZipVoice)またはクラウドサービス(Edge TTS、OpenAI互換、Azure Speech、ElevenLabsなど)で字幕テキストを音声トラックに変換。ゼロショットクラッキングにより、自分の声に合わせて合成可能。
    6. ビデオレンダリング:字幕を画像にハードバーンインするか、ソフトトラックとしてマスクする。フォント、色、影、位置など完全なスタイル設定とリアルタイムプレビューに対応。

すべてのステップは独立して実行可能。バッチ処理も可能。

なぜ重要か

  • プライバシー最優先:ASR、翻訳(Ollama経由)、TTSエンジンはすべてユーザーのマシン上で実行。クラウドサービスを明示的に有効化しない限り、音声や動画はコンピュータ外に送信されない。
  • ハードウェア対応:CPU、NVIDIA CUDA、AMD/Intel Vulkan、Apple Core ML/Metalをサポート。GPU加速パックはアプリ内に同梱されており、CUDAの手動インストール不要。
  • 無料で利用可能:有料APIキーなしでも完全なワークフローが実現可能。ローカルモデルは一度ダウンロードすれば再利用可能。組み込みの無料翻訳/TTSサービスには使用制限なし。
  • 拡張性:OpenAIスタイルのAPIエンドポイントを独自に追加可能。UIからリクエストパラメータを調整できるため、コードを触らずにカスタマイズ可能。

主な機能一覧

機能 詳細
動画ダウンロード yt-dlp(YouTube+1800以上サイト)または lux(中国系プラットフォーム)でワンクリックダウンロード。クッキー対応、複数リンクバッチ処理、公式字幕自動検出。
ASRエンジン 8種類の組み込みオプション。ローカル(whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet)とクラウドサービス(OpenAI、ElevenLabs Scribe、Deepgramなど)を併用可能。
AI字幕校正 Ollama経由のローカルLLMで意味的再分割+一括修正(句読点、同音異義語、フィラー除去)。
翻訳 20のプロバイダー対応。無料Bing/Google、中国系クラウド、大規模モデルAPI(Gemini、DeepSeek、Azure OpenAIなど)。カスタムパラメータJSONもサポート。
校正UI 動画と字幕をサイドバイサイド表示。元に戻す/やり直し、行単位の削除・復元、ワンクリックAI再作成。
TTS&ボイスクラッキング ローカル:Kokoro(103音声)、VITS(174中国語音声)— 無料・オフライン。ZipVoiceで短い参照音声からゼロショットクラッキング可能。クラウド:Edge TTS、OpenAI、Azure、ElevenLabsなど。
字幕レンダリング ハードバーンイン(永続的)またはソフトマスク(切り替え可能)で、完全なスタイルエディタとリアルタイムプレビュー。
クロスプラットフォーム Windows x64、macOS(Apple Silicon & Intel)、Linux x64。GitHubリリースまたはHomebrew(brew install --cask smartsub)でインストール可能。
GPU加速 CUDA、Vulkan、Core MLパックの自動検出とダウンロード。必要に応じてCPUにフォールバック。

一般的な利用シーン

  • 学習 – 外国語の講義やチュートリアルにバイリンガル字幕を追加。
  • コンテンツクリエイター – YouTubeやB‐站動画の字幕生成とダブリングを、サードパーティサービスの料金なしで実現。
  • ポッドキャスト/会議記録 – 音声ファイルを一括でトランスクリプト化し、検索可能なSRTファイルに変換。
  • 個人用ダブリング – 自分の声をクラッキングし、動画を完全にナレーション付きに変換。

導入方法

  1. OSに適したインストーラーをダウンロード(GPUパックはオプション)。
  2. アプリを起動し、オンボーディングウィザードに従って音声モデルを取得(またはクラウドASRを設定)。
  3. 動画をドラッグ&ドロップ、またはURLを貼り付け、元言語・対象言語を設定し、Startを押下。音声認識後、編集・翻訳・TTS合成を行い、最終的に完成した動画をエクスポート。

コミュニティと貢献

  • MITライセンスでオープンソース。IssueやPull Requestでの貢献を歓迎。
  • yarn installyarn dev でローカルビルド。ネイティブ依存(whisper addon、sherpa-onnx)は自動取得。
  • READMEにスポンサーシップオプション(DigitalOcean、Alipay/WeChat寄付、QQグループ)を掲載。

結論:SmartSubは、あらゆる動画を字幕付き・翻訳済み・ダブリング済みの製品に変換する完全なプライバシー保護型AIワークフローを、単一のクロスプラットフォームデスクトップアプリで提供します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト