LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler

Neural latent upscaler for Minimax H3 (24ch). Bypasses costly 5B-param VAE decode/encode. Upscale low-res latents directly, then refine. Accelerates high-res video gen, outperforms naive interp.

解决的问题

本项目提供了一个专为 Minimax H3 视频生成设计的神经网络潜在空间上采样器。它消除了将潜在变量解码为像素、上采样,再重新编码回潜在变量的缓慢且计算成本高昂的过程。通过在潜在空间内直接上采样,显著加速了高分辨率视频生成,同时避免了使用基本双线性或双三次插值时通常出现的鬼影和双重图像伪影。

工作原理

该工具以一组 ComfyUI 节点的形式实现,使用训练好的神经网络来提升 24 通道 Minimax H3 VAE 潜在变量的空间分辨率。提供两种不同的架构骨干:

  • 2D 变体:使用 2D ResBlock 骨干和 Temporal 3D-Conv 层以保持时间一致性,是一种轻量且快速的选项。
  • 3D 变体:使用完全 3D 卷积骨干(3D ResBlocks + TemporalConv + 三线性插值)的计算量更大的选项,以实现更强的时间一致性。

两种变体均支持 1.0x 到 4.0x 的缩放因子。3D 节点还允许用户通过乘数、目标尺寸或总兆像素来指定输出尺寸。

适用人群

使用 ComfyUI 生成 Minimax H3 视频并希望更快提升输出分辨率,同时避免简单插值带来的质量损失的用户。

主要亮点

  • 学习型上采样:使用约 8 万个配对样本训练的神经网络,生成结果比标准插值更清晰。
  • 两种骨干选项:可选择快速的 2D 模型或具有时间一致性的 3D 模型。
  • 灵活的尺寸控制:3D 节点支持按乘数、目标尺寸或兆像素进行缩放,并具备自动像素网格对齐功能。
  • 性能优化:包含时间分块以管理长视频的显存占用,支持多种精度级别(fp32、fp16、bf16)和设备(CUDA、ROCm、CPU)。
  • 即插即用:可直接作为自定义节点集成到 ComfyUI 中。

相关

  • 项目
  • 项目
  • Dispatch
  • 项目
  • 项目