LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler

Neural latent upscaler for Minimax H3 (24ch). Bypasses costly 5B-param VAE decode/encode. Upscale low-res latents directly, then refine. Accelerates high-res video gen, outperforms naive interp.

何を解決するか

このプロジェクトは、Minimax H3動画生成に特化したニューラル潜在空間アップスケーラーを提供します。従来の潜在空間からピクセルにデコードし、アップスケーリングしてから再エンコードするという遅く計算コストの高いプロセスを排除します。潜在空間内で直接アップスケーリングすることで、高解像度動画生成を大幅に高速化し、基本的なバイリニアまたはバイキュービック補間で生じる通常のゴーストや二重画像アーティファクトを回避します。

仕組み

このツールは、学習済みのニューラルネットワークを使用して24チャネルのMinimax H3 VAE潜在変数の空間解像度を向上させるComfyUIノードのセットとして実装されています。2つの異なるアーキテクチャバックボーンを提供しています:

  • 2Dバリアント:時間的一貫性を確保するためのTemporal 3D-Convレイヤーを備えた軽量かつ高速な2D ResBlockバックボーン。
  • 3Dバリアント:より高い時間的一貫性を実現するための完全3D畳み込みバックボーン(3D ResBlocks + TemporalConv + トリリニア補間)。

両方のバリアントは1.0xから4.0xまでのスケールファクターをサポートしています。3Dノードはさらに、乗数、ターゲットサイズ、または合計メガピクセルを指定して出力サイズを設定できます。

対象ユーザー

ComfyUIでMinimax H3を使用して動画を生成し、より高い解像度を高速かつ品質損失の少ない方法で得たいユーザー。

特徴

  • 学習済みアップスケーリング:約8万件のペアデータで学習されたニューラルネットワークにより、標準的な補間よりも鮮明な結果を実現。
  • 2つのバックボーンオプション:高速な2Dモデルまたは時間的一貫性のある3Dモデルの選択可能。
  • 柔軟なサイズ指定:3Dノードは乗数、ターゲットサイズ、メガピクセルでのスケーリングをサポートし、自動ピクセルグリッド整列を実装。
  • パフォーマンス最適化:長時間の動画処理に適した時間的チャンク処理と、複数の精度レベル(fp32, fp16, bf16)およびデバイス(CUDA, ROCm, CPU)をサポート。
  • プラグアンドプレイ:ComfyUIにカスタムノードとして直接統合可能。

関連

  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト
  • プロジェクト