bakrianoo/mazinger

End-to-end video dubbing pipeline

何を解決するか

Mazinger Dubber は、動画のダブリングのためのエンドツーエンド自動化パイプラインを提供します。ダウンロード、音声認識、翻訳、音声合成といった個別のツールを手動で扱う必要がなく、1つのコマンドまたはウェブインターフェースから完全にダブリングされたオーディオまたは動画ファイルを生成できます。

動作方法

このシステムは、10段階の再開可能なステージ(ダウンロード、音声認識、サムネイル作成、説明、レビュー、翻訳、再セグメンテーション、音声合成、アセンブリ、字幕生成)を連鎖させています。各ステージの出力をキャッシュするため、処理が中断された場合でも、中断した場所から再開可能です。以下のAIエンジンを統合しています:

  • 音声認識:CohereX(Studioでデフォルト)、Faster Whisper、Deepgram Nova 3 を使用。
  • 翻訳:LLM(Ollamaを介してローカルオプションも含む)を活用。
  • 音声合成:Qwen3-TTS や OmniVoice などの音声クローンTTSエンジンを使用。
  • オーディオ処理:背景音声の分離に Demucs を使用。

対象ユーザー

オリジナルの声を維持するか、事前に定義されたボイステーマを使用して、複雑な個別のAIツールチェーンを管理せずに、動画コンテンツを異なる言語に翻訳したいコンテンツクリエイターおよび開発者向けに設計されています。

特徴

  • 自動音声クローン:元の動画から20~60秒のサンプルを自動的に抽出し、オリジナルの声をクローンできます。
  • 柔軟な音声認識:ローカル音声認識(CohereX、Faster Whisper)とクラウドベースのオプション(Deepgram)をサポート。
  • 包括的な出力:アラビア語などRTL言語を含む、スタイリングされた埋め込み字幕付きのダブリング動画を生成可能。
  • ウェブUI:コマンドラインを使いたくないユーザー向けに、Gradioベースの「Mazinger Studio」を搭載。
  • モジュール式実行:ダブリングプロセスの各ステージを単体のコマンドとして実行可能、またはフルパイプラインの一部として実行可能。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト