shang-zhu/violin

Open-source Video Translation Skill

何を解決するか

Violinは、自然な感覚を維持しながら動画を異なる言語に翻訳するためのオープンソースツールです。元の音声を文字起こしし、テキストを翻訳し、ネイティブのような音声のナレーションを生成し、新しいオーディオを動画ファイルに同期させるという複雑なプロセスを自動化します。

仕組み

Violinは、AIモデルのプラグイン可能なパイプラインを使用して動画を処理します:

  1. 音声抽出: ffmpegを使用して動画から音声を抽出します。
  2. 文字起こし: Whisper Large v3を採用して、単語レベルのタイムスタンプと文章セグメントを作成します。
  3. 翻訳: LLM(デフォルトではDeepSeek V4 Pro)が、選択されたスタイルプロファイルに基づいてセグメントを翻訳します。
  4. 音声合成: TTSエンジン(デフォルトではCartesia Sonic 3)が吹き替え音声を生成します。
  5. リマキシング: ffmpegが動画の速度を吹き替え音声に合わせて調整し、オプションのSRT字幕付きで最終的な出力MP4をエンコードします。

対象者

手動の吹き替えサービスを利用することなく、33の対象言語でグローバルな視聴者に向けて動画コンテンツをローカライズする必要があるコンテンツクリエイターや開発者。

ハイライト

  • プラグイン可能なスタック: 単一のYAML設定を通じて、Together AI、OpenAI、ElevenLabsなどのプロバイダーを簡単に切り替えることができます。
  • スタイルプロファイル: 翻訳のトーンとTTSのデリバリーの両方を調整する6つの実験的なプロファイル(standard、kids、academic、casual、storyteller、news)があります。
  • 動画内Q&A: サンプリングされたフレームと字幕を使用して、吹き替えられた動画の特定の瞬間についてユーザーが質問することを可能にします。
  • 自然言語によるボイスピッカー: LLMを使用して、ユーザーの説明に基づいてカタログから最適な音声を選択します。
  • 柔軟なデプロイメント: CLIツール、FastAPIウェブアプリ、またはClaude Codeスキルとして利用可能です。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト