LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
Neural latent upscaler for Minimax H3 (24ch). Bypasses costly 5B-param VAE decode/encode. Upscale low-res latents directly, then refine. Accelerates high-res video gen, outperforms naive interp.
解決的問題
本專案提供一個專為 Minimax H3 影片生成設計的神經潛在空間上採樣器。它消除了將潛在變數解碼為像素、上採樣,再重新編碼回潛在變數的緩慢且計算成本高昂的過程。透過在潛在空間內直接上採樣,大幅加速高解析度影片生成,同時避免使用基本雙線性或雙三次插值時通常出現的鬼影與重影偽影。
工作原理
此工具以一組 ComfyUI 節點的形式實作,使用訓練好的神經網路來提升 24 通道 Minimax H3 VAE 潛在變數的空間解析度。提供兩種不同的架構骨幹:
- 2D 變體:使用 2D ResBlock 骨幹與 Temporal 3D-Conv 層以維持時間一致性,是一種輕量且快速的選項。
- 3D 變體:使用完全 3D 卷積骨幹(3D ResBlocks + TemporalConv + 三線性插值)的計算量較大的選項,以實現更強的時間一致性。
兩種變體均支援 1.0x 到 4.0x 的縮放因子。3D 節點還允許使用者透過乘數、目標尺寸或總兆像素來指定輸出尺寸。
適用對象
使用 ComfyUI 生成 Minimax H3 影片,並希望更快提升輸出解析度,同時避免簡單插值帶來的品質損失的使用者。
主要亮點
- 學習型上採樣:使用約 8 萬個配對樣本訓練的神經網路,生成結果比標準插值更清晰。
- 兩種骨幹選項:可選擇快速的 2D 模型或具時間一致性的 3D 模型。
- 靈活的尺寸控制:3D 節點支援按乘數、目標尺寸或兆像素進行縮放,並具備自動像素網格對齊功能。
- 效能優化:包含時間分塊以管理長影片的顯存使用,支援多種精度層級(fp32、fp16、bf16)與裝置(CUDA、ROCm、CPU)。
- 即插即用:可直接作為自訂節點整合至 ComfyUI 中。
相關
- 專案
- 專案
- Dispatch
- 專案
- 專案