Rimagination/h3lite

A hardware-aware Codex skill for local MiniMax H3 video generation through ComfyUI

解决的问题

H3 Lite 允许在消费级硬件上本地部署和运行 MiniMax H3 视频生成模型,特别针对使用 NVIDIA GPU 的 Windows 用户。通过提供优化的模型集(量化版本)和结构化工作流,解决了高质量视频生成所需的高硬件门槛问题,使 AI 代理能够从文本提示自动完成到最终带原生音频视频的生成过程。

如何工作

该项目与 ComfyUI 集成,提供两套优化的组件集:

  • 集 A:使用 W4A8 扩散模型和 4B INT4 文本编码器,实现低 VRAM、快速生成。
  • 集 B:使用 4B FP8 文本编码器,提供更好的兼容性。

采用四步式智能体工作流:意图路由(决定生成模式)、参考锚定(固定角色/场景)、提示增强(将简单请求扩展为详细多模态描述)、生成与确认(生成视频并检查连贯性)。

支持的模式包括:

  • T2VA:文本到视频(带音频)。
  • I2VA:图像到视频(带音频)(使用起始帧)。
  • FL2VA:首尾帧到视频。
  • Ref2VA:使用多个图像、视频或音频作为参考。

适用人群

  • 搭载 NVIDIA GPU 的 Windows 用户(尤其是 VRAM 有限的用户,如 8GB 或 16GB)。
  • 使用 Codex 或 WorkBuddy 等 AI 代理,希望在工作流中添加本地视频生成能力的用户。
  • 需要高质量、短时视频(通常 5-8 秒)并带有同步原生音频的创作者。

亮点

  • 低 VRAM 优化:特别针对 RTX 4070 笔记本(8GB)和 RTX 4060 Ti(16GB)等 GPU 优化。
  • 代理就绪:专为 AI 代理设计为「技能」,可自动处理安装、配置和提示工程。
  • 原生音频:生成的视频包含集成的音景与音乐。
  • 实时监控:内置原生 Windows GUI 监控器,可追踪采样进度、VRAM 使用情况和预计完成时间。

相关

  • Dispatch
  • 项目
  • 项目
  • 项目
  • 项目