R3gm/SoniTranslate
Synchronized Translation for Videos. Video dubbing
何を解決するか
SoniTranslateは、音声を同期させながら動画を異なる言語に翻訳するプロセスを簡素化します。トランスクリプション、翻訳、音声生成(ダブイング)を1つの使いやすいWebインターフェース内で一貫したパイプラインで処理できます。
動作方法
このアプリケーションはGradioベースのWeb UIを使用して、複数のAIモデルとツールを統合しています:
- トランスクリプション:Whisperベースのモデル(faster-whisperやWhisperXを含む)を使用して音声をテキストに変換します。
- 翻訳:deep-translatorやOpenAIのGPT APIなどのツールを使用して、トランスクリプトされたテキストを目的の言語に翻訳します。
- 音声生成:Piper、Coqui XTTS、BARK、Facebook-mmsなどのさまざまなText-to-Speech(TTS)エンジンを使用して翻訳された音声を生成します。また、OpenVoiceV2やRVCモデルによる音声の模倣もサポートしています。
- 処理:FFmpegでマルチメディア処理を行い、pyannote-audioで話者分離(誰が話しているかを識別)を行います。
対象ユーザー
複数の別々のトランスクリプション・ダブイングツールを手動で連携する必要なく、グローバルな視聴者向けに動画コンテンツをローカライズしたいコンテンツクリエイター、教育者、および関係者。
特徴
- 広範な言語対応:トランスクリプションおよび翻訳の両方で多数の言語をサポートしています。
- 音声クローンと模倣:Coqui XTTSおよびOpenVoiceV2との統合により、リアルな音声クローンと模倣が可能になります。
- 柔軟な入出力:YouTubeプレイリスト、ローカルファイル、URLをサポート。出力は動画、音声、字幕(ASSおよびソフト字幕を含む)が可能です。
- カスタマイズ可能なパイプライン:ユーザーは好みのASRモデル、TTSエンジン、翻訳方法(OpenAI API統合を含む)を選択できます。
- アクセシビリティ:ローカルインストールまたはGoogle Colabノートブックから利用可能。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト