yizhi-chengzi/video-ai-talking
想做真人口播,又不必自己对着镜头念。上传一段真人出镜视频,写好字幕,本机配音并对口型,合成竖屏 MP4。密钥只留在浏览器里。
video-ai-talking – AI駆動の「本物の人物」トークヘッド動画生成ツール
何であるか
- ローカルで実行されるウェブアプリで、人物の顔の静止映像を完全なトークヘッド動画に変換します。スクリプトを手動で入力するか、DeepSeekで自動生成させることができます。アプリは合成音声を生成し、Alibaba Bailian VideoRetalkを使って顔の動きと音声をリップシンクさせ、FFmpegで背景映像や字幕を追加して最終的な動画を編集します。
なぜ重要か
- オーディオ録音や手動のリップシンク編集が不要で、クリエイターが「トークヘッド」動画を簡単に作成できます。すべての処理はあなたのマシン上で行われ、クラウドサーバーにキー情報やメディアが保存されることはありません。
主要コンポーネント
| コンポーネント | 役割 | 提供元 |
|---|---|---|
| テキストから音声 | 音声を生成 | Alibaba Bailian CosyVoice または Volcengine (ByteDance) TTS |
| リップシンク | 音声と顔の動きを同期 | Alibaba Bailian VideoRetalk |
| スクリプト生成(オプション) | トピックからナレーションを自動生成 | DeepSeek LLM |
| 動画の統合 | 顔映像、生成音声、オプションのBGMや追加映像を統合し、字幕/タイトルを追加 | FFmpeg(ローカル) |
必要なもの
- Node 20+ と動作する FFmpeg/ffprobe のインストール。
- 使用するサービスのAPI認証情報:
- Bailian VideoRetalk(リップシンクに必須)
- Bailian CosyVoice または Volcengine TTS(音声生成)
- DeepSeek(オプション、AIによるスクリプト生成)
- 1人の人物の正面から撮影された短い静止映像(音声は不要)。
開始方法
# クローンとインストール
git clone https://github.com/yizhi-chengzi/video-ai-talking.git
cd video-ai-talking
cp .env.example .env
npm install
# 開発モード(http://127.0.0.1:5175 で起動)
npm run dev
- ウェブUIを開き、設定パネルにAPIキーを入力し、接続をテストします。
- 「トークヘッド」クリップをドラッグ&ドロップし、必要に応じて背景映像を追加。TTSのボイスを選択し、スクリプトを手動で入力するかAIが生成するようにします。
- 字幕/スキンスタイルを選択後、生成開始をクリック。パイプラインが実行されます:TTS → VideoRetalk → FFmpeg → 最終MP4。
- 完成した動画はライブラリパネルに表示され、プレビュー、ダウンロード、削除が可能です。
ローカルでのデータ処理
- APIキーはブラウザの
localStorageにのみ保存され、リモートサーバーに送信されません。 - 中間ファイル(JSONタスク記述、音声データ、リップシンク動画、最終MP4)はすべてプロジェクトの
data/フォルダ内に保存されます。 - VideoRetalkが一時的に必要とするアップロードファイルは、AlibabaのOSSに約48時間保存され、その後自動削除されます。
一般的な利用フロー
- 設定 – Bailian VideoRetalkのキーを入力。TTSプロバイダーを選択し、認証情報を入力。
- ソース動画の読み込み – 明確な正面映像のプレゼンターのクリップ。
- アセットの追加 – オプションのBGMやフルスクリーンのカットイン映像。
- スクリプト作成 – 手動で入力するか、DeepSeekが自動生成(長さ、トピックを選択)。
- スキンの選択 – 字幕スタイル、タイトルの表示などを選択。
- 生成 – アプリが音声、リップシンク動画、最終MP4を一括生成。
- レビュー – ライブラリから再生またはダウンロード。必要に応じて再生成。
開発とテスト
npm testで外部サービスをモックしたユニットテストを実行。npm run typecheckでTypeScriptの型チェックを実行。VAT_MOCK=1を設定すると、TTS、VideoRetalk、DeepSeekをオフラインでモックして実験可能。
セキュリティとライセンス
- MITライセンスですが、
DISCLAIMER.md、SECURITY.md、privacy.mdを参照し、使用上の注意(例:顔データは一時的にBailianにアップロードされる)に注意してください。 - READMEに表示されているデモ動画は、無償利用可能なストックライブラリからのものであり、本ツールの実際のユーザーによるものではありません。
結論:video-ai-talking は、現代のTTS、リップシンク、動画合成技術を組み合わせ、すべてのデータを自宅のコンピュータ上で保持する実用的なセルフホスティングツールです。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト