OmniCustom-project/OmniCustom
Official Implementation of 'OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model'
何を解決するか
OmniCustomは、同期的な音声・映像カスタマイズの課題に対処します。ユーザーは特定の人物の視覚的アイデンティティを維持し、特定の人物の声のトーンを模倣した音声トラックを生成しつつ、実際の発話内容はテキストプロンプトで制御できる動画を作成できます。
動作方法
このフレームワークは、OVIから微調整された統合音声・映像生成モデルを使用しています。異なるモダリティを処理するために、いくつかの専門的なコンポーネントを統合しています:
- 視覚的アイデンティティ:InsightFaceを使用して512次元の顔埋め込みを抽出し、LivePortraitで参照画像をクロップします。
- 声のトーン:Naturalspeech 3を使用して256次元のトーン埋め込みを抽出します。
- 音声生成:MMAudioのAudio VAEを使用します。
- 映像生成:映像ブランチはWan2.2から初期化されます。
ユーザーは参照画像、参照音声クリップ、および最終出力をガイドするテキストプロンプトを提供します。
対象ユーザー
実世界の参照に基づいて、外見と声の両方がカスタマイズされた同期したトークヘッド動画を作成したいコンテンツクリエイターおよび開発者。
特徴
- 統合生成:音声と映像を別々のステップとして扱うのではなく、同期して生成します。
- アイデンティティの保持:参照画像からの視覚的アイデンティティと、参照音声クリップからの声のトーンを維持します。
- テキスト駆動のコンテンツ:発話内容はテキストプロンプトで自由に指定できます。
- マルチモデル統合:OVI、Wan2.2、MMAudio、InsightFaceの強みを統合しています。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト