cclank/lanshu-create-ai-presenter-video
Provider-neutral Codex Skill for producing verified AI presenter videos from a script and an authorized presenter image.
何を解決するか
このプロジェクトは、AI駆動のデジタル人間プレゼンター動画を作成するための汎用的なワークフローを提供します。トピックやスクリプト、人物の参照画像を入力として、完全に編集された動画を自動生成します。デジタルアバターがテキストを発話し、口パクが音声と同期され、字幕と視覚効果が付加されます。
動作方法
このシステムはCodex用の「スキル」として動作し、特定のサービスプロバイダーに縛られず、複数のAI機能(音声生成、動画生成、口パク同期)を連携させます。プロセスは音声トラックに基づく厳密なタイムラインに従います:
- 準備段階:スクリプトとライセンス付き参照画像を入力します。
- 生成段階:完全なナレーションを生成し、これが動画全体のマスタータイムラインとなります。
- 制作段階:デジタル人間の映像を生成し、口パクが音声と正確に同期するように調整します。
- 後処理段階:字幕、キーワードアニメーション、カバーを追加し、FFmpegを使用して最終動画をレンダリングします。
- 品質保証段階:技術的・手動でのチェックを行い、音声と映像の整合性と品質を確認した後、最終マスターファイルと共有用バージョンを出力します。
対象ユーザー
複数のAIツールを手動で連携する必要なく、プロフェッショナルな質のデジタル人間プレゼン動画を制作したい、Codex互換エージェント環境のコンテンツクリエイターおよびユーザー。
特徴
- プロバイダー非依存:特定のモデルやプライベートAPIに依存せず、現在の環境で利用可能なツールを自由に使用可能。
- 音声中心のタイムライン:完全なナレーションを主タイムラインとして使用し、口パクのずれやシームレスなトランジションを防止。
- 自動パイプライン:スクリプトの整理からナレーション生成、編集、レンダリング、品質保証レポートまでを自動で処理。
- セキュリティとコスト制御:画像・音声のライセンス確認と、課金生成前のコスト見積もりを内蔵したチェック機能を備えています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト