LBH-123-AI/Comfyui_Minimax_h3_latent_Upscaler
Neural latent upscaler for Minimax H3 (24ch). Bypasses costly 5B-param VAE decode/encode. Upscale low-res latents directly, then refine. Accelerates high-res video gen, outperforms naive interp.
해결하는 문제
이 프로젝트는 Minimax H3 동영상 생성을 위해 특별히 설계된 신경망 기반 잠재 공간 업스케일러를 제공합니다. 잠재 벡터를 픽셀로 디코딩하고, 이를 업스케일링한 후 다시 잠재 벡터로 인코딩하는 느리고 계산 비용이 큰 과정을 제거합니다. 잠재 공간 내에서 직접 업스케일링함으로써 고해상도 동영상 생성을 크게 가속화하고, 기본적인 이선형 또는 이차선형 보간법에서 흔히 발생하는 그림자 및 중복 이미지 아티팩트를 피할 수 있습니다.
작동 방식
이 도구는 학습된 신경망을 사용하여 24채널 Minimax H3 VAE 잠재 벡터의 공간 해상도를 증가시키는 ComfyUI 노드 세트로 구현됩니다. 두 가지 다른 아키텍처 백본을 제공합니다:
- 2D 버전: 시간 일관성을 유지하기 위해 Temporal 3D-Conv 레이어를 사용하는 가볍고 빠른 2D ResBlock 백본.
- 3D 버전: 더 강한 시간 일관성을 위해 완전한 3D 컨볼루션 백본(3D ResBlocks + TemporalConv + 삼선형 보간)을 사용하는 더 많은 컴퓨팅 자원이 필요한 옵션.
두 버전 모두 1.0x에서 4.0x까지의 스케일 팩터를 지원합니다. 3D 노드는 추가로 스크레일 팩터, 목표 크기, 또는 총 메가픽셀을 통해 출력 크기를 지정할 수 있습니다.
대상 사용자
ComfyUI를 사용하여 Minimax H3로 동영상을 생성하고, 더 높은 해상도를 더 빠르게 얻고, 단순 보간법과 관련된 동일한 품질 손실 없이 원하는 사용자.
주요 특징
- 학습된 업스케일링: 약 8만 개의 쌍 데이터로 학습된 신경망을 사용하여 표준 보간보다 더 선명한 결과를 제공.
- 두 가지 백본 옵션: 빠른 2D 모델 또는 시간 일관성이 뛰어난 3D 모델 중 선택 가능.
- 유연한 크기 지정: 3D 노드는 스크레일 팩터, 목표 크기, 또는 메가픽셀 기반으로 스케일링을 지원하며, 자동 픽셀 그리드 정렬 기능 포함.
- 성능 최적화: 긴 동영상 처리를 위해 시간 기반 청크 처리를 지원하고, 여러 정밀도 수준(fp32, fp16, bf16) 및 장치(CUDA, ROCm, CPU)를 지원.
- 즉시 사용 가능: ComfyUI에 커스텀 노드로 직접 통합 가능.
관련
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트
- 프로젝트