Rimagination/h3lite
A hardware-aware Codex skill for local MiniMax H3 video generation through ComfyUI
解决的问题
H3 Lite 允许在消费级硬件上本地部署和运行 MiniMax H3 视频生成模型,特别针对使用 NVIDIA GPU 的 Windows 用户。通过提供优化的模型集(量化版本)和结构化工作流,解决了高质量视频生成所需的高硬件门槛问题,使 AI 代理能够从文本提示自动完成到最终带原生音频视频的生成过程。
如何工作
该项目与 ComfyUI 集成,提供两套优化的组件集:
- 集 A:使用 W4A8 扩散模型和 4B INT4 文本编码器,实现低 VRAM、快速生成。
- 集 B:使用 4B FP8 文本编码器,提供更好的兼容性。
采用四步式智能体工作流:意图路由(决定生成模式)、参考锚定(固定角色/场景)、提示增强(将简单请求扩展为详细多模态描述)、生成与确认(生成视频并检查连贯性)。
支持的模式包括:
- T2VA:文本到视频(带音频)。
- I2VA:图像到视频(带音频)(使用起始帧)。
- FL2VA:首尾帧到视频。
- Ref2VA:使用多个图像、视频或音频作为参考。
适用人群
- 搭载 NVIDIA GPU 的 Windows 用户(尤其是 VRAM 有限的用户,如 8GB 或 16GB)。
- 使用 Codex 或 WorkBuddy 等 AI 代理,希望在工作流中添加本地视频生成能力的用户。
- 需要高质量、短时视频(通常 5-8 秒)并带有同步原生音频的创作者。
亮点
- 低 VRAM 优化:特别针对 RTX 4070 笔记本(8GB)和 RTX 4060 Ti(16GB)等 GPU 优化。
- 代理就绪:专为 AI 代理设计为「技能」,可自动处理安装、配置和提示工程。
- 原生音频:生成的视频包含集成的音景与音乐。
- 实时监控:内置原生 Windows GUI 监控器,可追踪采样进度、VRAM 使用情况和预计完成时间。
相关
- Dispatch
- 项目
- 项目
- 项目
- 项目