ModelTC/Minimax-H3-Turbo

Distill Minimax-H3 into 4 steps

解决的问题

本项目为 MiniMax-H3 模型提供优化的 LoRA 检查点,以实现更快的视频和音频生成。它减少了生成高质量结果所需的推理步数(NFE),有效“加速”了文本到视频、图像到视频以及参考图像到视频的任务生成过程。

工作原理

使用 4 到 8 步的蒸馏 LoRA 检查点,使模型能够显著减少 Transformer 评估次数来生成内容。该项目支持多种任务:

  • T2VA/FL2VA:文本到视频和音频,或首帧到视频和音频。
  • Ref2VA:参考图像到视频和音频。

包含针对参考图像的特定缩放策略(matchmaxdiffusers),以确保输入与训练时的分辨率和宽高比匹配,从而保持视觉一致性。

适用人群

  • 使用 MiniMax-H3 进行视频生成的 AI 艺术家和开发者。
  • 使用 Diffusers 库或 ComfyUI 且希望在不牺牲太多质量的前提下缩短推理时间的用户。

主要亮点

  • 快速推理:提供 4 步和 8 步的加速模型,加快生成速度。
  • 灵活集成:提供适用于 Diffusers 和 ComfyUI 的检查点和工作流。
  • 多任务支持:支持文本到视频、图像到视频以及基于参考的视频生成,并附带音频。
  • 分辨率选项:包含在不同分辨率(如 544p 和 768p)下训练的模型。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目