HKUDS/ViMax
"ViMax: Agentic Video Generation (Director, Screenwriter, Producer, and Video Generator All-in-One)"
📽️ ViMax – 代理驅動的端對端影片生成
是什麼 – ViMax 是一個開源框架,可讓您從純文字想法(或完整劇本)直接生成完成的影片,無需拼接多個獨立工具。它透過執行由 LLM 驅動的代理循環來實現:這些代理負責撰寫劇本、設計分鏡、生成一致的角色影像,最後呼叫 AI 影片生成器。整個流程可透過終端 UI 或瀏覽器端 Web UI 驅動。
✨ 核心功能
| 功能 | 你將獲得 |
|---|---|
| Idea2Video | 輸入一個簡短概念;ViMax 會建立故事大綱、角色、劇本、鏡頭清單、分鏡,並渲染出一段短影片。 |
| Script2Video | 提供劇本;系統規劃鏡頭、保持視覺連貫性,並生成多場景影片。 |
| Novel2Video | 將較長的虛構作品轉化為分集影片,處理敘事壓縮與角色追蹤。 |
| AutoCameo | 上傳人物或寵物的照片,讓該主體在生成的故事中始終保持一致出現。 |
| 代理循環 + TUI | 互動式、聊天風格的規劃,可修改想法、恢復會話,並從終端監控渲染狀態。 |
| Web UI | 瀏覽器工作區,支援命名專案、資產與分鏡預覽、渲染檢查點、檔案上傳與提供者設定(支援深色模式)。 |
| 並行生成 | 鏡頭與媒體資產並行生成,加快多鏡頭製作速度。 |
| 提供者無關 | 支援任何提供 HTTP API 的 LLM、影像模型或影片模型(OpenAI、OpenRouter、Google Gemini、Seedance 等)。 |
🛠️ 快速入門(Linux / Windows)
# 1️⃣ 克隆倉儲
git clone https://github.com/HKUDS/ViMax.git && cd ViMax
# 2️⃣ 使用 uv 安裝 Python 環境(也可用 pip)
uv sync # 建立虛擬環境並安裝相依性
執行終端 UI
# 複製範例設定並填入你的 API 金鑰
cp configs/agent.example.yaml configs/agent.local.yaml
# 編輯 YAML – 設定 LLM、影像和影片模型/提供者細節
vim configs/agent.local.yaml
# 啟動互動式 TUI
vimax tui # 新會話
vimax tui new # 或恢復現有會話
執行瀏覽器 UI
cd web
npm install # 一次性前端安裝(需 Node 18+)
npm run dev # 在 http://127.0.0.1:4173 啟動開發伺服器
- 若後端運行在遠端機器上,請依照 README 所述使用 SSH 進行埠轉發。
📂 範例工作流程
- Idea2Video – 編輯
main_idea2video.py,輸入簡短提示和可選風格/需求,然後執行。腳本會讀取configs/idea2video.yaml中的 LLM、影像和影片端點。 - Script2Video – 編輯
main_script2video.py,輸入完整劇本並執行腳本。設定位於configs/script2video.yaml。 兩個腳本都會建立一個工作目錄(.working_dir/...),用於儲存生成的文本、影像、分鏡和最終影片。
📦 倉儲內容
| 目錄 / 檔案 | 用途 |
|---|---|
configs/ |
三個模型提供者(LLM、影像、影片)的範例 YAML 檔案。 |
web/ |
基於 React 的前端;npm run dev 提供 UI。 |
tools/ |
包裝特定影像/影片 API 的 Python 類別(例如 ImageGeneratorNanobananaGoogleAPI)。 |
main_idea2video.py / main_script2video.py |
展示兩個主要流程的最小入口點。 |
README.md |
本文檔,以及徽章、新聞、示範與快速入門說明。 |
🚀 最近亮點(截至 README)
- v1.2.0 – 支援命名專案、資產預覽、渲染檢查點和深色模式的 Web UI。
- 新增 OpenRouter GPT-Image-2-Image 和 Seedance 2.0 快速影片生成。
- 集成 代理循環 + TUI,支援互動式規劃與會話復用。
- 發布一份 技術報告 和 Novel2Video 工作流程。
🎯 誰會使用 ViMax?
- 希望在不聘請完整製作團隊的情況下,快速原型化動畫短片的獨立創作者。
- 尋找快速、圖文並茂的故事影片用於教學的教育工作者。
- 探索多模態 LLM 流程(文字 → 分鏡 → 影片)並需要模組化、可擴展程式碼庫的研究人員。
- 希望接入自己影像或影片生成模型的開發者。
📜 許可證
MIT – 您可自由使用、修改與重新分發程式碼。
📚 進一步閱讀
- ArXiv 論文 –
2606.07649(連結於徽章中)。 - YouTube 頻道 – 「AI-Creator-is-here」提供示範影片與教學。
✅ TL;DR
ViMax 將 LLM 驅動的規劃、一致的影像生成與 AI 影片合成整合為單一、以代理為中心的工作流程。透過終端 UI、現代化 Web UI,以及對任何 LLM/影像/影片提供者的插件支援,您只需輸入一個故事想法,即可獲得完成的影片,使 AI 生成影片製作變得更為便捷。
相關
- 專案
- 專案
- 專案
- 專案
- 專案