Robbyant/lingbot-world-v2
Infinite Worlds with Versatile Interactions
🤖 什么是 LingBot‑World‑V2?
LingBot‑World‑V2(也称为 LingBot‑World‑Infinity)是一个研究级生成模型,能够从文本提示中创建交互式、视频级的世界。它基于原始的 LingBot‑World 项目,并增加了四项主要升级:
- 无限制的交互范围 – 由于采用因果预训练方案,模型可以持续生成高质量的视频帧,适用于任意长度的场景。
- 实时速度 – 一个精简的“快速”变体可在多GPU系统上以60 fps实时驱动720p视频。
- 更丰富的交互集合 – 新增攻击、弓箭、施法、射击等行为,以及大量文本驱动事件,使世界具备更广泛的可交互词汇。
- 代理框架 – 一个 飞行员 代理规划角色行为,而一个 导演 代理持续生成新颖的环境元素,实现真正动态的世界演化。
该仓库提供推理代码(无训练代码)和已发布模型检查点的下载链接。
📦 快速入门(非专家用户)
克隆与安装
git clone https://github.com/robbyant/lingbot-world-v2.git cd lingbot-world-v2 # 需要 PyTorch ≥2.4 pip install -r requirements.txt # Flash‑Attention 可加速 Transformer 内核 pip install flash-attn --no-build-isolation下载模型 – 从四个已发布的检查点中选择一个。以14 B快速模型(Hugging Face)为例:
pip install "huggingface_hub[cli]" huggingface-cli download robbyant/lingbot-world-v2-14b-causal-fast \ --local-dir ./lingbot-world-v2-14b-causal-fast(1.3 B 模型与14 B版本共享 T5/VAE 分词器和 VAE 权重;通过
--assets_dir传入14 B文件夹。)运行推理 – 提供的
generate.py以分块方式流式输出视频帧,有效控制内存占用。# 示例:14 B 快速模型,480p 视频,8个 GPU torchrun --nproc_per_node=8 generate.py \ --task i2v-A14B \ --size 480*832 \ --ckpt_dir lingbot-world-v2-14b-causal-fast \ --image examples/03/image.jpg \ --action_path examples/03 \ --dit_fsdp --t5_fsdp \ --ulysses_size 8 \ --frame_num 361 \ --local_attn_size 18 --sink_size 6 \ --prompt "A serene lakeside scene …"对于较小的1.3 B快速模型,将
--nproc_per_node=4并添加--assets_dir lingbot-world-v2-14b-causal-fast。也可使用辅助脚本
run_fast.sh代替完整命令:bash run_fast.sh lingbot-world-v2-14b-causal-fast 361观看输出 – 脚本会生成视频文件(如
output.mp4),可用任意媒体播放器播放。
📂 仓库内容
| 文件夹/文件 | 用途 |
|---|---|
generate.py |
主要推理脚本(因果KV缓存,分块视频生成) |
run_fast.sh |
便捷包装器,从检查点名称自动推断GPU数量和模型大小 |
requirements.txt |
Python依赖(torch, transformers, flash‑attention 等) |
examples/ |
演示提示中使用的示例图像和动作路径文件 |
README.md(本文件) |
文档、模型下载表、快速入门指南 |
代码基于 Wan2.2(视频扩散框架)构建。Wan2.2的完整安装说明请参见其独立仓库。
📦 可用模型检查点
| 模型 | 大小 | 类型 | 获取方式 |
|---|---|---|---|
lingbot-world-v2-14b-causal-fast |
14 B | 实时精简(快速) | 🤗 [HuggingFace] & 🤖 [ModelScope] |
lingbot-world-v2-14b-causal-pretrain |
14 B | 因果预训练(高质量,较慢) | 🤗 [HuggingFace] |
lingbot-world-v2-14b-bid |
14 B | 双向(研究用) | 🤗 [HuggingFace] |
lingbot-world-v2-1.3b-causal-fast |
1.3 B | 轻量快速变体 | 🤗 [HuggingFace] |
所有模型均以 CC BY‑NC‑SA 4.0(仅限非商业用途)发布。1.3 B 包含的仅是扩散(DiT)权重;分词器、T5 编码器和 VAE 与14 B版本共享。
🌐 在线体验
- 国际网页演示 – 在 Reactor 上托管: https://www.reactor.inc/lingbot-world-v2
- 国内移动端演示 – 在 LingGuang 上托管: https://www.lingguang.com/support
两个平台均实时运行完整功能模型。官方演示将在 WAIC 2026 会议中展示,详见 README 中的链接。
📚 相关工作与引用
- 原始 LingBot‑World 项目: https://github.com/robbyant/lingbot-world
- 技术报告(arXiv): https://arxiv.org/abs/2607.07534
- 若在研究中使用该模型,请引用:
@article{lingbot-world-v2, title={Infinite Worlds with Versatile Interactions}, author={Zelin Gao and Qiuyu Wang and Jiapeng Zhu and Jingye Chen and Zichen Liu and Qingyan Bai and Jiahao Wang and Yufeng Yuan and Hanlin Wang and Yichong Lu and Ka Leong Cheng and Haojie Zhang and Jian Gao and Tianrui Feng and Yuzheng Liu and Yao Yao and Yinghao Xu and Xing Zhu and Yujun Shen and Hao Ouyang}, journal={arXiv preprint arXiv:2607.07534}, year={2026} }
📄 许可证
代码和模型权重以 Creative Commons Attribution‑NonCommercial‑ShareAlike 4.0 International 许可发布。您可非商业用途下共享和修改材料,但需适当署名,并以相同许可证分发衍生作品。
TL;DR
- 是什么:一个可无限持续演化的虚拟世界生成模型,提供快速(实时)和高质量两种版本。
- 为何重要:支持交互式AI驱动的模拟、游戏或虚拟环境研究,世界可对长期文本指令做出响应。
- 如何开始:安装依赖,下载检查点,使用提示和源图像运行
generate.py(或run_fast.sh)。 - 在哪里体验:Reactor(网页)和 LingGuang(移动端)提供实时演示。
相关
- 项目
- 项目
- 项目
- 项目