ComfyUI 对 MiniMax H3 的支持

ComfyUI 现在为 MiniMax H3 提供了首日支持,这是一款开源权重的全模态视频模型。该模型允许用户生成高达 2K 分辨率的高清视频,并带有原生立体声音频,视频片段时长可达 15 秒。

模型能力与多模态上下文

MiniMax H3 被设计为一个全模态模型,这意味着它可以同时处理多种输入类型——文本、图像、视频和音频——以生成最终的视频输出。这使得视频生成过程更加集成化,模型可以根据提示词解析不同模态之间的关系。

核心生成模式

  • Text-to-Video (T2V): 仅根据文本提示词生成视频。
  • Image-to-Video (I2V): 将静态图像转化为视频片段。
  • First-and-Last-Frame: 提供对起始帧和结束帧的控制,允许模型在两者之间进行运动插值。
  • Reference-to-Video (R2V): 使用参考图像、视频或音频来在整个片段中保持主体、动作或声音的一致性。

原生立体声音频

与许多将音频作为后期处理步骤添加的视频模型不同,MiniMax H3 在视频生成的同一过程中原生生成立体声音频。这确保了音频是模型本身的一个属性,而非后期强行添加的插件。

运动传递与编辑

该模型支持运动传递(motion transfer),即通过参考视频提供摄像机运动、表演或剪辑节奏,而主体和风格由其他输入定义。这种能力结合原地编辑(in-place editing),可以实现对特定镜头的迭代优化。

本地推理优化

为了让 MiniMax H3 能够在消费级硬件上运行,ComfyUI 实施了多项机器学习工程优化以减少内存占用。

内存减少技术

  • Weight Pruning: 大约 40% 的模型调制权重被剪枝并替换为功能等效的查找表,这在不牺牲输出质量的情况下减少了内存使用。
  • Quantization: 权重以 int8 convrot 量化方式发布。
  • VRAM Management: 使用自定义内核和动态 VRAM 卸载技术来降低推理过程中的峰值 VRAM 使用量。

这些优化将总内存占用从全精度下的 123.6 GB 降低到了最小模型变体下的 42.5 GB。这使得该模型可以在 RTX 3060 等 GPU 上本地运行。

用户实现与性能表现

要在 ComfyUI 中使用 MiniMax H3,用户必须更新到 0.30.0 版本。T2V、I2V 和 R2V 的工作流已在模板库中提供。

实际性能观察

报告其硬件配置的社区成员指出:

  • RTX 4070 Ti Super (16GB VRAM): 生成一段 10 秒的 480p 视频大约需要 10 分钟。
  • RTX GPU (General): 生成一段 10 秒、半百万像素的视频可以在几分钟内完成。

社区见解

用户强调了模型当前状态的优缺点:

"鼠标的渲染效果出奇地好... 唯一看起来有点"不太对劲"的是开罐时的饮料广告视频,它仍然带有那种"AI 平滑感"。"

"Reference-to-video 模式似乎是实现完全独立电影感的最后一块拼图,因为目前如果不改变场景的大部分内容,就无法将不同的场景正确地拼接在一起。"

一些用户指出,虽然模型在标准场景下表现出色,但在尝试更奇怪、更复杂的概念时(例如人被转动在轮子上),仍然会出现"卡顿"现象。

Sources