buxuku/SmartSub
视频转字幕、字幕翻译、AI 配音与声音克隆、字幕烧录——免费开源的一站式桌面工具。基于 Whisper / FunASR 等本地模型离线语音转文字,批量处理 + 全平台 GPU 加速,跨 Windows / macOS / Linux。Free, open-source desktop app to generate, translate, dub & burn video subtitles — local Whisper speech-to-text, AI dubbing & voice cloning, offline, GPU-accelerated.
SmartSub (妙幕) – サブタイトル、翻訳、AIダブリングのワンストップデスクトップツール
機能概要
- YouTube、B‐站などのオンラインリンクまたは動画ファイルを入力し、以下のパイプラインを実行します:
- ダウンロード:元の動画と既存の字幕を取得。
- 音声認識(ASR):
whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeetなどのローカルモデル、またはクラウドASRサービス(オプション)を使用。 - 翻訳:最大20の翻訳バックエンド(無料のBing/Google API、Baidu、Azure、DeepL-X、Ollama、Geminiなど)で生成された字幕を翻訳可能。純粋な翻訳または「原文+翻訳」のバイリンガル字幕を出力可。
- 校正:インタラクティブエディタで字幕を編集・校正可能。AI補助による自然な文章修正も可能。
- 音声合成(TTS)とボイスクラッキング:ローカルモデル(Kokoro、VITS、ZipVoice)またはクラウドサービス(Edge TTS、OpenAI互換、Azure Speech、ElevenLabsなど)で字幕テキストを音声トラックに変換。ゼロショットクラッキングにより、自分の声に合わせて合成可能。
- ビデオレンダリング:字幕を画像にハードバーンインするか、ソフトトラックとしてマスクする。フォント、色、影、位置など完全なスタイル設定とリアルタイムプレビューに対応。
すべてのステップは独立して実行可能。バッチ処理も可能。
なぜ重要か
- プライバシー最優先:ASR、翻訳(Ollama経由)、TTSエンジンはすべてユーザーのマシン上で実行。クラウドサービスを明示的に有効化しない限り、音声や動画はコンピュータ外に送信されない。
- ハードウェア対応:CPU、NVIDIA CUDA、AMD/Intel Vulkan、Apple Core ML/Metalをサポート。GPU加速パックはアプリ内に同梱されており、CUDAの手動インストール不要。
- 無料で利用可能:有料APIキーなしでも完全なワークフローが実現可能。ローカルモデルは一度ダウンロードすれば再利用可能。組み込みの無料翻訳/TTSサービスには使用制限なし。
- 拡張性:OpenAIスタイルのAPIエンドポイントを独自に追加可能。UIからリクエストパラメータを調整できるため、コードを触らずにカスタマイズ可能。
主な機能一覧
| 機能 | 詳細 |
|---|---|
| 動画ダウンロード | yt-dlp(YouTube+1800以上サイト)または lux(中国系プラットフォーム)でワンクリックダウンロード。クッキー対応、複数リンクバッチ処理、公式字幕自動検出。 |
| ASRエンジン | 8種類の組み込みオプション。ローカル(whisper.cpp、faster-whisper、FunASR、Qwen3-ASR、FireRedASR、NVIDIA Parakeet)とクラウドサービス(OpenAI、ElevenLabs Scribe、Deepgramなど)を併用可能。 |
| AI字幕校正 | Ollama経由のローカルLLMで意味的再分割+一括修正(句読点、同音異義語、フィラー除去)。 |
| 翻訳 | 20のプロバイダー対応。無料Bing/Google、中国系クラウド、大規模モデルAPI(Gemini、DeepSeek、Azure OpenAIなど)。カスタムパラメータJSONもサポート。 |
| 校正UI | 動画と字幕をサイドバイサイド表示。元に戻す/やり直し、行単位の削除・復元、ワンクリックAI再作成。 |
| TTS&ボイスクラッキング | ローカル:Kokoro(103音声)、VITS(174中国語音声)— 無料・オフライン。ZipVoiceで短い参照音声からゼロショットクラッキング可能。クラウド:Edge TTS、OpenAI、Azure、ElevenLabsなど。 |
| 字幕レンダリング | ハードバーンイン(永続的)またはソフトマスク(切り替え可能)で、完全なスタイルエディタとリアルタイムプレビュー。 |
| クロスプラットフォーム | Windows x64、macOS(Apple Silicon & Intel)、Linux x64。GitHubリリースまたはHomebrew(brew install --cask smartsub)でインストール可能。 |
| GPU加速 | CUDA、Vulkan、Core MLパックの自動検出とダウンロード。必要に応じてCPUにフォールバック。 |
一般的な利用シーン
- 学習 – 外国語の講義やチュートリアルにバイリンガル字幕を追加。
- コンテンツクリエイター – YouTubeやB‐站動画の字幕生成とダブリングを、サードパーティサービスの料金なしで実現。
- ポッドキャスト/会議記録 – 音声ファイルを一括でトランスクリプト化し、検索可能なSRTファイルに変換。
- 個人用ダブリング – 自分の声をクラッキングし、動画を完全にナレーション付きに変換。
導入方法
- OSに適したインストーラーをダウンロード(GPUパックはオプション)。
- アプリを起動し、オンボーディングウィザードに従って音声モデルを取得(またはクラウドASRを設定)。
- 動画をドラッグ&ドロップ、またはURLを貼り付け、元言語・対象言語を設定し、Startを押下。音声認識後、編集・翻訳・TTS合成を行い、最終的に完成した動画をエクスポート。
コミュニティと貢献
- MITライセンスでオープンソース。IssueやPull Requestでの貢献を歓迎。
yarn installとyarn devでローカルビルド。ネイティブ依存(whisper addon、sherpa-onnx)は自動取得。- READMEにスポンサーシップオプション(DigitalOcean、Alipay/WeChat寄付、QQグループ)を掲載。
結論:SmartSubは、あらゆる動画を字幕付き・翻訳済み・ダブリング済みの製品に変換する完全なプライバシー保護型AIワークフローを、単一のクロスプラットフォームデスクトップアプリで提供します。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト