HKUDS/ViMax

"ViMax: Agentic Video Generation (Director, Screenwriter, Producer, and Video Generator All-in-One)"

📽️ ViMax – エージェント駆動型エンドツーエンド動画生成

何であるか – ViMaxは、単純なテキストアイデア(または完全な脚本)から完成した動画にまで到達できるオープンソースフレームワークです。別々のツールを組み合わせる必要はありません。これは、LLM駆動のエージェントのループを実行することで実現されます。エージェントは脚本の作成、ストーリーボードの設計、一貫性のあるキャラクター画像の生成、そして最終的にAI動画生成器を呼び出す作業を行います。この全体的なパイプラインは、ターミナルUIまたはブラウザベースのWeb UIから制御できます。


✨ コア機能

機能 得られるもの
Idea2Video 短いコンセプトを入力すると、ViMaxはストーリーの概要、キャラクター、脚本、ショットリスト、ストーリーボードを作成し、短いクリップをレンダリングします。
Script2Video 脚本を提供すると、システムはショットを計画し、視覚的な一貫性を保ち、複数シーンの動画を生成します。
Novel2Video より長いフィクションをエピソード形式の動画に変換し、物語の要約とキャラクターの追跡を処理します。
AutoCameo 人物やペットの写真をアップロードすると、生成された物語全体に一貫してその登場人物が登場します。
エージェントループ + TUI インタラクティブでチャットスタイルの計画が可能。アイデアの修正、セッションの再開、レンダリング状態の監視がターミナルから行えます。
Web UI 名前付きプロジェクト、アーティファクトとストーリーボードのプレビュー、レンダリングチェックポイント、ファイルアップロード、プロバイダ設定(ダークモード対応)を備えたブラウザワークスペース。
並列生成 ショットとメディア資産を同時に生成することで、複数ショットの制作を高速化します。
プロバイダ非依存 HTTP APIを提供する任意のLLM、画像モデル、動画モデル(OpenAI、OpenRouter、Google Gemini、Seedanceなど)に対応するプラグインサポート。

🛠️ クイックスタート(Linux / Windows)

# 1️⃣ リポジトリをクローン
git clone https://github.com/HKUDS/ViMax.git && cd ViMax

# 2️⃣ uvでPython環境をインストール(pipも可)
uv sync   # 仮想環境を作成し、依存関係をインストール

ターミナルUIの実行

# 例の設定ファイルをコピーし、APIキーを入力
cp configs/agent.example.yaml configs/agent.local.yaml
# YAMLを編集 – LLM、画像、動画モデル/プロバイダの詳細を設定
vim configs/agent.local.yaml

# インタラクティブなTUIを開始
vimax tui          # 新しいセッション
vimax tui new      # または既存のセッションを再開

ブラウザUIの実行

cd web
npm install        # 1回限りのフロントエンドインストール(Node 18+必須)
pm run dev        # http://127.0.0.1:4173 で開発サーバーを起動
  • バックエンドがリモートマシン上で動作している場合、READMEに記載の通りSSHでポートフォワーディングを行う必要があります。

📂 例のワークフロー

  • Idea2Videomain_idea2video.py を編集し、短いプロンプトとオプションのスタイル/要件を記入して実行。スクリプトは configs/idea2video.yaml を読み込み、LLM、画像、動画エンドポイントを取得します。
  • Script2Videomain_script2video.py を編集し、完全な脚本を記入してスクリプトを実行。設定は configs/script2video.yaml にあります。 両方のスクリプトは、生成されたテキスト、画像、ストーリーボード、最終的な動画を格納する作業ディレクトリ(.working_dir/...)を作成します。

📦 リポジトリの中身

ディレクトリ / ファイル 目的
configs/ 3つのモデルプロバイダ(LLM、画像、動画)用の例のYAMLファイル。
web/ Reactベースのフロントエンド;npm run dev でUIを提供。
tools/ 特定の画像/動画APIをラップするPythonクラス(例:ImageGeneratorNanobananaGoogleAPI)。
main_idea2video.py / main_script2video.py 2つの主要なパイプラインを示す最小限のエントリポイント。
README.md このドキュメント、バッジ、ニュース、デモ、クイックスタート手順。

🚀 最近のハイライト(README時点)

  • v1.2.0 – 名前付きプロジェクト、アーティファクトプレビュー、レンダリングチェックポイント、ダークモードを備えたWeb UI。
  • OpenRouter GPT-Image-2-ImageSeedance 2.0 の高速動画生成を追加。
  • エージェントループ + TUI を統合し、インタラクティブな計画とセッション再利用を可能に。
  • 技術レポートNovel2Video ワークフローをリリース。

🎯 誰がViMaxを使うべきか?

  • フルプロダクションチームを雇わずに、アニメーションショートをプロトタイピングしたいインディークリエイター。
  • 教室用の図解付きストーリービデオを素早く作成したい教育者。
  • 多モーダルLLMパイプライン(テキスト → ストーリーボード → 動画)を研究し、モジュール化・拡張可能なコードベースが必要な研究者。
  • 自分の画像または動画生成モデルを統合したい開発者。

📜 ライセンス

MIT – コードを自由に使用、変更、再配布できます。


📚 詳細情報

  • ArXiv論文2606.07649(バッジにリンク済み)。
  • YouTubeチャンネル – 「AI-Creator-is-here」でデモ動画とチュートリアルを配信。

✅ TL;DR

ViMaxは、LLM駆動の計画、一貫性のある画像生成、AI動画合成を1つのエージェント中心のワークフローに統合しています。ターミナルUI、モダンなWebUI、任意のLLM/画像/動画プロバイダへのプラグインサポートを備え、ストーリーのアイデアを入力するだけで完成した動画を手に入れられます。これにより、AI生成動画制作がはるかにアクセスしやすくなりました。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト