Robbyant/lingbot-world-v2
Infinite Worlds with Versatile Interactions
🤖 LingBot‑World‑V2 とは何ですか?
LingBot‑World‑V2(別名 LingBot‑World‑Infinity)は、テキストプロンプトからインタラクティブでビデオレベルの世界を生成する研究用生成モデルです。オリジナルの LingBot‑World プロジェクトを基盤とし、以下の4つの主要な進化を加えています。
- 無限のインタラクション範囲 – 因果的事前学習スキームにより、品質を維持したまま任意の長さのシーンを一貫してビデオフレーム生成可能。
- リアルタイム速度 – 小型化された「高速」バージョンは、マルチGPU環境で720p 60fpsの動画をリアルタイムで駆動可能。
- 豊富な行動セット – 攻撃、弓矢、呪文唱え、射撃など新たな行動に加え、多数のテキスト駆動イベントにより、世界の行動語彙が大幅に拡張。
- エージェントハーネス – パイロットエージェントがキャラクター行動を計画し、ディレクターエージェントが継続的に新しい環境要素を生成することで、真に動的な世界進化を実現。
リポジトリには推論コード(学習コードは非公開)と、公開されたモデルチェックポイントへのリンクが含まれます。
📦 クイックスタート(非専門家向け)
クローン&インストール
git clone https://github.com/robbyant/lingbot-world-v2.git cd lingbot-world-v2 # PyTorch ≥2.4 が必要 pip install -r requirements.txt # Flash‑Attention でTransformerカーネルを高速化 pip install flash-attn --no-build-isolationモデルのダウンロード – 公開された4つのチェックポイントから1つを選択。14 B高速モデル(Hugging Face)の例:
pip install "huggingface_hub[cli]" huggingface-cli download robbyant/lingbot-world-v2-14b-causal-fast \ --local-dir ./lingbot-world-v2-14b-causal-fast(1.3 Bモデルは14 BリリースとT5/VAEトークナイザーおよびVAE重みを共有。
--assets_dirで14 Bフォルダを指定)推論実行 – 提供された
generate.pyは、チャンク単位でビデオフレームをストリーミングし、メモリ使用量を低く抑えます。# 例:14 B高速モデル、480p動画、8GPU torchrun --nproc_per_node=8 generate.py \ --task i2v-A14B \ --size 480*832 \ --ckpt_dir lingbot-world-v2-14b-causal-fast \ --image examples/03/image.jpg \ --action_path examples/03 \ --dit_fsdp --t5_fsdp \ --ulysses_size 8 \ --frame_num 361 \ --local_attn_size 18 --sink_size 6 \ --prompt "A serene lakeside scene …"小型の1.3 B高速モデルの場合は
--nproc_per_node=4を指定し、--assets_dir lingbot-world-v2-14b-causal-fastを追加。完全なコマンドを書く代わりに、ヘルパー スクリプト
run_fast.shを使用可能:bash run_fast.sh lingbot-world-v2-14b-causal-fast 361出力の確認 – スクリプトは
output.mp4のような動画ファイルを出力。任意のメディアプレーヤーで再生可能。
📂 リポジトリの内容
| フォルダ/ファイル | 機能 |
|---|---|
generate.py |
主要な推論スクリプト(因果的KVキャッシュ、チャンク単位のビデオ生成) |
run_fast.sh |
GPU数とモデルサイズをチェックポイント名から自動検出する便利なラッパー |
requirements.txt |
Python依存パッケージ(torch, transformers, flash‑attention など) |
examples/ |
デモプロンプトで使用されるサンプル画像とアクションパスファイル |
README.md(このファイル) |
ドキュメント、モデルダウンロード表、クイックスタートガイド |
コードは Wan2.2(ビデオディフュージョンフレームワーク)に基づいて構築されています。Wan2.2の完全なインストール手順は、独自リポジトリを参照してください。
📦 利用可能なモデルチェックポイント
| モデル | サイズ | タイプ | 取得先 |
|---|---|---|---|
lingbot-world-v2-14b-causal-fast |
14 B | リアルタイム小型化(高速) | 🤗 [HuggingFace] & 🤖 [ModelScope] |
lingbot-world-v2-14b-causal-pretrain |
14 B | 因果的事前学習(高品質、遅め) | 🤗 [HuggingFace] |
lingbot-world-v2-14b-bid |
14 B | 双方向(研究用) | 🤗 [HuggingFace] |
lingbot-world-v2-1.3b-causal-fast |
1.3 B | 軽量高速バージョン | 🤗 [HuggingFace] |
すべてのモデルは CC BY‑NC‑SA 4.0(非営利利用限定)でリリース。1.3 Bパッケージは現在、ディフュージョン(DiT)重みのみを含み、トークナイザー、T5エンコーダー、VAEは14 Bリリースと共有。
🌐 オンラインで試す
- 国際版ウェブデモ – Reactor 上でホスト: https://www.reactor.inc/lingbot-world-v2
- 国内モバイルデモ – LingGuang 上でホスト: https://www.lingguang.com/support
両プラットフォームはリアルタイムでフル機能モデルを実行。公式デモは WAIC 2026 会議向けに、README内のリンクからアクセス可能。
📚 関連研究・引用
- オリジナル LingBot‑World プロジェクト: https://github.com/robbyant/lingbot-world
- 技術レポート(arXiv): https://arxiv.org/abs/2607.07534
- 研究でモデルを使用する場合、以下の引用を記載してください:
@article{lingbot-world-v2, title={Infinite Worlds with Versatile Interactions}, author={Zelin Gao and Qiuyu Wang and Jiapeng Zhu and Jingye Chen and Zichen Liu and Qingyan Bai and Jiahao Wang and Yufeng Yuan and Hanlin Wang and Yichong Lu and Ka Leong Cheng and Haojie Zhang and Jian Gao and Tianrui Feng and Yuzheng Liu and Yao Yao and Yinghao Xu and Xing Zhu and Yujun Shen and Hao Ouyang}, journal={arXiv preprint arXiv:2607.07534}, year={2026} }
📄 ライセンス
コードおよびモデル重みは Creative Commons Attribution‑NonCommercial‑ShareAlike 4.0 International の下でリリースされます。非営利目的で素材を共有・改変可能ですが、適切なクレジット表示と、派生作品を同じライセンスで配布する必要があります。
TL;DR
- 何ですか:無限に進化する仮想世界を、高速(リアルタイム)および高品質なバージョンで生成する動画生成モデル。
- なぜ重要か:長期間にわたるテキストコマンドに応じて反応するインタラクティブAI駆動シミュレーション、ゲーム、仮想環境研究を可能に。
- 始め方:依存関係をインストール、チェックポイントをダウンロード、
generate.py(またはrun_fast.sh)をプロンプトと画像で実行。 - 体験場所:Reactor(ウェブ)とLingGuang(モバイル)でライブデモをご覧いただけます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト