HKUDS/ViMax
"ViMax: Agentic Video Generation (Director, Screenwriter, Producer, and Video Generator All-in-One)"
📽️ ViMax – エージェント駆動型エンドツーエンド動画生成
何であるか – ViMaxは、単純なテキストアイデア(または完全な脚本)から完成した動画にまで到達できるオープンソースフレームワークです。別々のツールを組み合わせる必要はありません。これは、LLM駆動のエージェントのループを実行することで実現されます。エージェントは脚本の作成、ストーリーボードの設計、一貫性のあるキャラクター画像の生成、そして最終的にAI動画生成器を呼び出す作業を行います。この全体的なパイプラインは、ターミナルUIまたはブラウザベースのWeb UIから制御できます。
✨ コア機能
| 機能 | 得られるもの |
|---|---|
| Idea2Video | 短いコンセプトを入力すると、ViMaxはストーリーの概要、キャラクター、脚本、ショットリスト、ストーリーボードを作成し、短いクリップをレンダリングします。 |
| Script2Video | 脚本を提供すると、システムはショットを計画し、視覚的な一貫性を保ち、複数シーンの動画を生成します。 |
| Novel2Video | より長いフィクションをエピソード形式の動画に変換し、物語の要約とキャラクターの追跡を処理します。 |
| AutoCameo | 人物やペットの写真をアップロードすると、生成された物語全体に一貫してその登場人物が登場します。 |
| エージェントループ + TUI | インタラクティブでチャットスタイルの計画が可能。アイデアの修正、セッションの再開、レンダリング状態の監視がターミナルから行えます。 |
| Web UI | 名前付きプロジェクト、アーティファクトとストーリーボードのプレビュー、レンダリングチェックポイント、ファイルアップロード、プロバイダ設定(ダークモード対応)を備えたブラウザワークスペース。 |
| 並列生成 | ショットとメディア資産を同時に生成することで、複数ショットの制作を高速化します。 |
| プロバイダ非依存 | HTTP APIを提供する任意のLLM、画像モデル、動画モデル(OpenAI、OpenRouter、Google Gemini、Seedanceなど)に対応するプラグインサポート。 |
🛠️ クイックスタート(Linux / Windows)
# 1️⃣ リポジトリをクローン
git clone https://github.com/HKUDS/ViMax.git && cd ViMax
# 2️⃣ uvでPython環境をインストール(pipも可)
uv sync # 仮想環境を作成し、依存関係をインストール
ターミナルUIの実行
# 例の設定ファイルをコピーし、APIキーを入力
cp configs/agent.example.yaml configs/agent.local.yaml
# YAMLを編集 – LLM、画像、動画モデル/プロバイダの詳細を設定
vim configs/agent.local.yaml
# インタラクティブなTUIを開始
vimax tui # 新しいセッション
vimax tui new # または既存のセッションを再開
ブラウザUIの実行
cd web
npm install # 1回限りのフロントエンドインストール(Node 18+必須)
pm run dev # http://127.0.0.1:4173 で開発サーバーを起動
- バックエンドがリモートマシン上で動作している場合、READMEに記載の通りSSHでポートフォワーディングを行う必要があります。
📂 例のワークフロー
- Idea2Video –
main_idea2video.pyを編集し、短いプロンプトとオプションのスタイル/要件を記入して実行。スクリプトはconfigs/idea2video.yamlを読み込み、LLM、画像、動画エンドポイントを取得します。 - Script2Video –
main_script2video.pyを編集し、完全な脚本を記入してスクリプトを実行。設定はconfigs/script2video.yamlにあります。 両方のスクリプトは、生成されたテキスト、画像、ストーリーボード、最終的な動画を格納する作業ディレクトリ(.working_dir/...)を作成します。
📦 リポジトリの中身
| ディレクトリ / ファイル | 目的 |
|---|---|
configs/ |
3つのモデルプロバイダ(LLM、画像、動画)用の例のYAMLファイル。 |
web/ |
Reactベースのフロントエンド;npm run dev でUIを提供。 |
tools/ |
特定の画像/動画APIをラップするPythonクラス(例:ImageGeneratorNanobananaGoogleAPI)。 |
main_idea2video.py / main_script2video.py |
2つの主要なパイプラインを示す最小限のエントリポイント。 |
README.md |
このドキュメント、バッジ、ニュース、デモ、クイックスタート手順。 |
🚀 最近のハイライト(README時点)
- v1.2.0 – 名前付きプロジェクト、アーティファクトプレビュー、レンダリングチェックポイント、ダークモードを備えたWeb UI。
- OpenRouter GPT-Image-2-Image と Seedance 2.0 の高速動画生成を追加。
- エージェントループ + TUI を統合し、インタラクティブな計画とセッション再利用を可能に。
- 技術レポート と Novel2Video ワークフローをリリース。
🎯 誰がViMaxを使うべきか?
- フルプロダクションチームを雇わずに、アニメーションショートをプロトタイピングしたいインディークリエイター。
- 教室用の図解付きストーリービデオを素早く作成したい教育者。
- 多モーダルLLMパイプライン(テキスト → ストーリーボード → 動画)を研究し、モジュール化・拡張可能なコードベースが必要な研究者。
- 自分の画像または動画生成モデルを統合したい開発者。
📜 ライセンス
MIT – コードを自由に使用、変更、再配布できます。
📚 詳細情報
- ArXiv論文 –
2606.07649(バッジにリンク済み)。 - YouTubeチャンネル – 「AI-Creator-is-here」でデモ動画とチュートリアルを配信。
✅ TL;DR
ViMaxは、LLM駆動の計画、一貫性のある画像生成、AI動画合成を1つのエージェント中心のワークフローに統合しています。ターミナルUI、モダンなWebUI、任意のLLM/画像/動画プロバイダへのプラグインサポートを備え、ストーリーのアイデアを入力するだけで完成した動画を手に入れられます。これにより、AI生成動画制作がはるかにアクセスしやすくなりました。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト