antirez/h3.c

MiniMax H3 inference engine for Mac computers

What it solves

Apple Silicon 상의 MiniMax-H3 모델을 위한 네이티브 Metal 기반 추론 엔진을 제공하여, macOS 장치에서 텍스트 프롬프트, 이미지 또는 기타 미디어 참조를 통해 비디오와 오디오를 고성능으로 생성할 수 있게 합니다.

How it works

이 프로젝트는 GPU 가속을 위해 Apple의 Metal 프레임워크를 사용하여 MiniMax-H3 아키텍처를 구현합니다. 속도와 품질의 균형을 맞추기 위해 다음과 같은 다양한 최적화 기술을 지원합니다:

  • Denoising Control: 계산 시간을 줄이기 위해 조정 가능한 디노이징 패스와 속도 외삽(reuse)을 지원합니다.
  • Layer Thinning: 트랜스포머 블록의 일부만 실행하여 메모리 및 계산 요구 사항을 낮춥니다.
  • SSD Streaming: 저메모리 장치를 지원하기 위해 SSD에서 GPU 메모리로 모델 블록을 온디맨드로 로드합니다.
  • Reference Conditioning: 이미지-투-비디오 또는 비디오-투-비디오 작업을 위해 첫/마지막 프레임 앵커(FL2VA) 및 순서화된 미디어 참조(Ref2VA)를 지원합니다.
  • Memory Optimizations: 메모리 디스패치 및 전역 재읽기를 최소화하기 위해 Fused gates 및 AdaLN 작업을 수행합니다.

Who it’s for

고품질 비디오 및 오디오 합성을 위해 MiniMax-H3 생성 모델을 로컬에서 실행하고자 하는 Apple Silicon(M 시리즈 칩) 사용자 개발자 및 크리에이터.

Highlights

  • Native Apple Silicon Support: M3 Max 및 M5 Max 칩에 특화되어 최적화되었습니다.
  • Flexible Generation: 프롬프트-투-비디오/오디오, 이미지-투-비디오, 그리고 오디오 보존 또는 교체를 포함한 비디오-투-비디오 생성을 지원합니다.
  • H3-Specific Optimizations: 토큰 감소, 내부 캔버스 스케일링, 저해상도 프리뷰를 위한 특화된 RoPE 적응을 포함합니다.
  • Interactive Session: 모델 구성 요소를 메모리에 유지하여 더 빠른 반복 프롬프트 생성을 가능하게 하는 Iris-style의 대화형 CLI.
  • Low-Memory Mode: SSD 스트리밍을 통해 메모리 용량이 제한된 장치에서도 모델을 실행할 수 있습니다.

관련

  • Dispatch
  • 프로젝트
  • Dispatch
  • 프로젝트
  • 프로젝트