jianchang512/pyvideotrans

Translate the video from one language to another and embed dubbing & subtitles.

解決する課題

本ツールは、動画をある言語から別の言語へ翻訳する複雑なプロセスを自動化します。手動で文字起こし、翻訳、音声の再録音を行う代わりに、音声認識、字幕翻訳、AI吹き替えを統合されたワークフローで処理し、音声と映像の同期を維持します。

仕組み

このプロジェクトは、以下のマルチステージ・パイプラインを実装しています:

  1. 音声認識 (ASR): Faster-Whisperや各種クラウドAPIなどのモデルを使用して、音声からテキスト字幕に変換します。
  2. 字幕翻訳: LLM(DeepSeek、ChatGPT、またはローカルのOllamaモデルなど)を使用して、テキストをターゲット言語に翻訳します。
  3. 音声合成 (TTS): ターゲット言語で新しい音声を生成します。マルチロール割り当てとボイスクローニング(F5-TTS、CosyVoiceなどを使用)をサポートしています。
  4. 動画合成: 新しい音声と翻訳された字幕を元の動画に再度マージします。

対象ユーザー

コンテンツクリエイター、開発者、および動画コンテンツを効率的にローカライズする必要があるすべての方向けに設計されています。シンプルなWindows実行ファイル、サーバー用のコマンドラインインターフェース、またはWebベースのUIから選択可能です。

ハイライト

  • エンドツーエンドの自動化: オリジナル動画から翻訳・吹き替え済み動画まで、ワンクリックのワークフロー。
  • ボイスクローニング: 高度なTTSモデルとの統合による、ゼロショット・ボイスクローニング。
  • 話者分離 (Speaker Diarization): 異なる話者を識別し、各ロールに固有のAI音声。を割り当てることが可能。
  • 柔軟なデプロイ: ローカルでのオフライン実行、クラウドAPI、Docker、およびパッケージ化されたWindows .exe をサポート。
  • インタラクティブな編集: 音声認識、翻訳、吹き替えの各段階で、ユーザーが手動でテキストを校正・編集できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト