yizhi-chengzi/video-ai-talking

想做真人口播,又不必自己对着镜头念。上传一段真人出镜视频,写好字幕,本机配音并对口型,合成竖屏 MP4。密钥只留在浏览器里。

video-ai-talking – AI駆動の「本物の人物」トークヘッド動画生成ツール

何であるか

  • ローカルで実行されるウェブアプリで、人物の顔の静止映像を完全なトークヘッド動画に変換します。スクリプトを手動で入力するか、DeepSeekで自動生成させることができます。アプリは合成音声を生成し、Alibaba Bailian VideoRetalkを使って顔の動きと音声をリップシンクさせ、FFmpegで背景映像や字幕を追加して最終的な動画を編集します。

なぜ重要か

  • オーディオ録音や手動のリップシンク編集が不要で、クリエイターが「トークヘッド」動画を簡単に作成できます。すべての処理はあなたのマシン上で行われ、クラウドサーバーにキー情報やメディアが保存されることはありません。

主要コンポーネント

コンポーネント 役割 提供元
テキストから音声 音声を生成 Alibaba Bailian CosyVoice または Volcengine (ByteDance) TTS
リップシンク 音声と顔の動きを同期 Alibaba Bailian VideoRetalk
スクリプト生成(オプション) トピックからナレーションを自動生成 DeepSeek LLM
動画の統合 顔映像、生成音声、オプションのBGMや追加映像を統合し、字幕/タイトルを追加 FFmpeg(ローカル)

必要なもの

  • Node 20+ と動作する FFmpeg/ffprobe のインストール。
  • 使用するサービスのAPI認証情報:
    • Bailian VideoRetalk(リップシンクに必須)
    • Bailian CosyVoice または Volcengine TTS(音声生成)
    • DeepSeek(オプション、AIによるスクリプト生成)
  • 1人の人物の正面から撮影された短い静止映像(音声は不要)。

開始方法

# クローンとインストール
git clone https://github.com/yizhi-chengzi/video-ai-talking.git
cd video-ai-talking
cp .env.example .env
npm install

# 開発モード(http://127.0.0.1:5175 で起動)
npm run dev
  • ウェブUIを開き、設定パネルにAPIキーを入力し、接続をテストします。
  • 「トークヘッド」クリップをドラッグ&ドロップし、必要に応じて背景映像を追加。TTSのボイスを選択し、スクリプトを手動で入力するかAIが生成するようにします。
  • 字幕/スキンスタイルを選択後、生成開始をクリック。パイプラインが実行されます:TTS → VideoRetalk → FFmpeg → 最終MP4。
  • 完成した動画はライブラリパネルに表示され、プレビュー、ダウンロード、削除が可能です。

ローカルでのデータ処理

  • APIキーはブラウザの localStorage にのみ保存され、リモートサーバーに送信されません。
  • 中間ファイル(JSONタスク記述、音声データ、リップシンク動画、最終MP4)はすべてプロジェクトの data/ フォルダ内に保存されます。
  • VideoRetalkが一時的に必要とするアップロードファイルは、AlibabaのOSSに約48時間保存され、その後自動削除されます。

一般的な利用フロー

  1. 設定 – Bailian VideoRetalkのキーを入力。TTSプロバイダーを選択し、認証情報を入力。
  2. ソース動画の読み込み – 明確な正面映像のプレゼンターのクリップ。
  3. アセットの追加 – オプションのBGMやフルスクリーンのカットイン映像。
  4. スクリプト作成 – 手動で入力するか、DeepSeekが自動生成(長さ、トピックを選択)。
  5. スキンの選択 – 字幕スタイル、タイトルの表示などを選択。
  6. 生成 – アプリが音声、リップシンク動画、最終MP4を一括生成。
  7. レビュー – ライブラリから再生またはダウンロード。必要に応じて再生成。

開発とテスト

  • npm test で外部サービスをモックしたユニットテストを実行。
  • npm run typecheck でTypeScriptの型チェックを実行。
  • VAT_MOCK=1 を設定すると、TTS、VideoRetalk、DeepSeekをオフラインでモックして実験可能。

セキュリティとライセンス

  • MITライセンスですが、DISCLAIMER.mdSECURITY.mdprivacy.md を参照し、使用上の注意(例:顔データは一時的にBailianにアップロードされる)に注意してください。
  • READMEに表示されているデモ動画は、無償利用可能なストックライブラリからのものであり、本ツールの実際のユーザーによるものではありません。

結論video-ai-talking は、現代のTTS、リップシンク、動画合成技術を組み合わせ、すべてのデータを自宅のコンピュータ上で保持する実用的なセルフホスティングツールです。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト