Carasibana/ComfyUI-H3-FaceRefine

Refine and improve the quality of small faces in MiniMax H3 video. Per-frame face tracking, crop, refine with H3, stitch back.

何を解決するか

このプロジェクトは、MiniMax H3動画における小さな顔の描画品質の低さに対処します。画面上で頭部が小さな領域を占める場合、出力解像度に関係なく品質が低下します。これらのノードは、顔の検出、切り出し、精緻化、元の動画への合成というプロセスを自動化し、詳細と品質を回復します。

動作方法

ComfyUI内でのマルチステップパイプラインを使用しています:

  1. トラッキングと切り出し:各フレームで顔を検出し、軌道を滑らかにして「ボイル(ジッター)」を防止し、顔をキャンバスにフィットするように切り出します。
  2. 潜在空間への注入:これらの切り出し画像をH3の音声・動画同時潜在空間にエンコードし、標準のH3ノードではネイティブにサポートされていない動画から動画への(img2img)ワークフローを可能にします。
  3. 動的ノイズ除去:顔のサイズに応じて各フレームごとにノイズ除去強度を調整します。小さな顔には詳細を追加するための強い合成を、大きな顔には既存の詳細を保持するための穏やかな処理を適用します。
  4. 精緻化:MiniMax H3モデルが切り出し画像を再生成します。
  5. 合成:精緻化された切り出し画像を、サブピクセル精度で元のフレームにワープし、明るさの変化を防ぐために色補正を行い、フェード処理で元の動画に自然に溶け込ませます。

対象ユーザー

ComfyUIおよびMiniMax H3動画モデルのユーザーで、遠くにいる人物や画面上で小さな人物の顔の詳細と一貫性を向上させたい方。

特徴

  • 時間的滑らかさ:切り出し中心とサイズにガウスまたはSavgol平滑化を適用し、精緻化された顔がちらついたりジッターしないようにします。
  • アイデンティティトラッキング:特定の人物を群衆中や遮蔽中でも追跡するために、参照画像を使用できます。
  • フレームごとのノイズ除去:元の動画における顔の実際のピクセルサイズに基づいて、ノイズ除去強度を自動的にスケーリングします。
  • 柔軟なマスク:シンプルな矩形マスクと、高精度なSAM(Segment Anything Model)マスクの両方を提供し、自然なブレンドを実現します。
  • サブピクセル合成:バッチ処理された grid_sample を使用して、精緻化された顔を正確に元の位置に戻します。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト