LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
Neural latent upscaler for Minimax H3 (24ch). Bypasses costly 5B-param VAE decode/encode. Upscale low-res latents directly, then refine. Accelerates high-res video gen, outperforms naive interp.
何を解決するか
このプロジェクトは、Minimax H3動画生成に特化したニューラル潜在空間アップスケーラーを提供します。従来の潜在空間からピクセルにデコードし、アップスケーリングしてから再エンコードするという遅く計算コストの高いプロセスを排除します。潜在空間内で直接アップスケーリングすることで、高解像度動画生成を大幅に高速化し、基本的なバイリニアまたはバイキュービック補間で生じる通常のゴーストや二重画像アーティファクトを回避します。
仕組み
このツールは、学習済みのニューラルネットワークを使用して24チャネルのMinimax H3 VAE潜在変数の空間解像度を向上させるComfyUIノードのセットとして実装されています。2つの異なるアーキテクチャバックボーンを提供しています:
- 2Dバリアント:時間的一貫性を確保するためのTemporal 3D-Convレイヤーを備えた軽量かつ高速な2D ResBlockバックボーン。
- 3Dバリアント:より高い時間的一貫性を実現するための完全3D畳み込みバックボーン(3D ResBlocks + TemporalConv + トリリニア補間)。
両方のバリアントは1.0xから4.0xまでのスケールファクターをサポートしています。3Dノードはさらに、乗数、ターゲットサイズ、または合計メガピクセルを指定して出力サイズを設定できます。
対象ユーザー
ComfyUIでMinimax H3を使用して動画を生成し、より高い解像度を高速かつ品質損失の少ない方法で得たいユーザー。
特徴
- 学習済みアップスケーリング:約8万件のペアデータで学習されたニューラルネットワークにより、標準的な補間よりも鮮明な結果を実現。
- 2つのバックボーンオプション:高速な2Dモデルまたは時間的一貫性のある3Dモデルの選択可能。
- 柔軟なサイズ指定:3Dノードは乗数、ターゲットサイズ、メガピクセルでのスケーリングをサポートし、自動ピクセルグリッド整列を実装。
- パフォーマンス最適化:長時間の動画処理に適した時間的チャンク処理と、複数の精度レベル(fp32, fp16, bf16)およびデバイス(CUDA, ROCm, CPU)をサポート。
- プラグアンドプレイ:ComfyUIにカスタムノードとして直接統合可能。
関連
- プロジェクト
- プロジェクト
- Dispatch
- プロジェクト
- プロジェクト