HKUDS/ViMax
"ViMax: Agentic Video Generation (Director, Screenwriter, Producer, and Video Generator All-in-One)"
📽️ ViMax – 代理驱动的端到端视频生成
是什么 – ViMax 是一个开源框架,可让您从纯文本想法(或完整剧本)直接生成完成的视频,无需拼接多个独立工具。它通过运行由 LLM 驱动的代理循环来实现:这些代理负责编写脚本、设计分镜、生成一致的角色图像,最后调用 AI 视频生成器。整个流程可通过终端 UI 或浏览器端 Web UI 驱动。
✨ 核心功能
| 功能 | 你将获得 |
|---|---|
| Idea2Video | 输入一个简短概念;ViMax 会创建故事大纲、角色、剧本、镜头列表、分镜,并渲染出一段短视频。 |
| Script2Video | 提供剧本;系统规划镜头、保持视觉连贯性,并生成多场景视频。 |
| Novel2Video | 将较长的虚构作品转化为分集视频,处理叙事压缩和角色追踪。 |
| AutoCameo | 上传人物或宠物的照片,让该主体在生成的故事中始终保持一致出现。 |
| 代理循环 + TUI | 交互式、聊天风格的规划,可修改想法、恢复会话,并从终端监控渲染状态。 |
| Web UI | 浏览器工作区,支持命名项目、资产与分镜预览、渲染检查点、文件上传和提供者配置(支持深色模式)。 |
| 并行生成 | 镜头和媒体资产并行生成,加快多镜头制作速度。 |
| 提供者无关 | 支持任何提供 HTTP API 的 LLM、图像模型或视频模型(OpenAI、OpenRouter、Google Gemini、Seedance 等)。 |
🛠️ 快速入门(Linux / Windows)
# 1️⃣ 克隆仓库
git clone https://github.com/HKUDS/ViMax.git && cd ViMax
# 2️⃣ 使用 uv 安装 Python 环境(也可用 pip)
uv sync # 创建虚拟环境并安装依赖
运行终端 UI
# 复制示例配置并填写你的 API 密钥
cp configs/agent.example.yaml configs/agent.local.yaml
# 编辑 YAML – 设置 LLM、图像和视频模型/提供者详情
vim configs/agent.local.yaml
# 启动交互式 TUI
vimax tui # 新会话
vimax tui new # 或恢复现有会话
运行浏览器 UI
cd web
npm install # 一次性前端安装(需 Node 18+)
npm run dev # 在 http://127.0.0.1:4173 启动开发服务器
- 如果后端运行在远程机器上,请按 README 中所述使用 SSH 进行端口转发。
📂 示例工作流
- Idea2Video – 编辑
main_idea2video.py,输入简短提示和可选风格/要求,然后运行。脚本会读取configs/idea2video.yaml中的 LLM、图像和视频端点。 - Script2Video – 编辑
main_script2video.py,输入完整剧本并运行脚本。配置位于configs/script2video.yaml。 两个脚本都会创建一个工作目录(.working_dir/...),用于存储生成的文本、图像、分镜和最终视频。
📦 仓库内容
| 目录 / 文件 | 用途 |
|---|---|
configs/ |
三个模型提供者(LLM、图像、视频)的示例 YAML 文件。 |
web/ |
基于 React 的前端;npm run dev 提供 UI。 |
tools/ |
包装特定图像/视频 API 的 Python 类(例如 ImageGeneratorNanobananaGoogleAPI)。 |
main_idea2video.py / main_script2video.py |
展示两个主要流程的最小入口点。 |
README.md |
本文档,以及徽章、新闻、演示和快速入门说明。 |
🚀 最近亮点(截至 README)
- v1.2.0 – 支持命名项目、资产预览、渲染检查点和深色模式的 Web UI。
- 新增 OpenRouter GPT-Image-2-Image 和 Seedance 2.0 快速视频生成。
- 集成 代理循环 + TUI,支持交互式规划和会话复用。
- 发布一份 技术报告 和 Novel2Video 工作流。
🎯 谁会使用 ViMax?
- 希望在不雇佣完整制作团队的情况下,快速原型化动画短片的独立创作者。
- 寻找快速、图文并茂的故事视频用于教学的教育工作者。
- 探索多模态 LLM 流程(文本 → 分镜 → 视频)并需要模块化、可扩展代码库的研究人员。
- 希望接入自己图像或视频生成模型的开发者。
📜 许可证
MIT – 您可以自由使用、修改和重新分发代码。
📚 进一步阅读
- ArXiv 论文 –
2606.07649(链接在徽章中)。 - YouTube 频道 – “AI-Creator-is-here” 提供演示视频和教程。
✅ TL;DR
ViMax 将 LLM 驱动的规划、一致的图像生成和 AI 视频合成整合为单一、以代理为中心的工作流。通过终端 UI、现代 Web UI 以及对任何 LLM/图像/视频提供者的插件支持,您只需输入一个故事想法,即可获得完成的视频,使 AI 生成视频制作变得更为便捷。
相关
- 项目
- 项目
- 项目
- 项目
- 项目