Robbyant/lingbot-world-v2
Infinite Worlds with Versatile Interactions
🤖 LingBot‑World‑V2 는 무엇입니까?
LingBot‑World‑V2 (또는 LingBot‑World‑Infinity 라고도 함)는 텍스트 프롬프트에서 인터랙티브한 비디오 수준의 세계를 생성하는 연구용 생성 모델입니다. 원래의 LingBot‑World 프로젝트를 기반으로 하며, 다음과 같은 네 가지 주요 업그레이드를 추가했습니다.
- 무한한 상호작용 범위 – 인과적 사전 훈련 방식 덕분에 품질을 유지하면서도 임의로 긴 장면에 대해 지속적으로 일관된 비디오 프레임을 생성할 수 있습니다.
- 실시간 속도 – 소규모화된 "빠른" 버전은 멀티 GPU 환경에서 720p 60fps 비디오를 실시간으로 구동할 수 있을 정도로 빠릅니다.
- 더 풍부한 상호작용 세트 – 공격, 궁술, 주문 시전, 사격 등 새로운 행동과 수많은 텍스트 기반 이벤트를 통해 세계의 행동 어휘가 훨씬 넓어졌습니다.
- 에이전트 하네스 – 파일럿 에이전트가 캐릭터 행동을 계획하고, 디렉터 에이전트가 지속적으로 새로운 환경 요소를 생성함으로써 진정한 동적 세계 진화를 가능하게 합니다.
리포지토리는 추론 코드 (학습 코드는 포함되지 않음)와 공개된 모델 체크포인트 링크를 제공합니다.
📦 빠른 시작 (비전문가용)
클론 및 설치
git clone https://github.com/robbyant/lingbot-world-v2.git cd lingbot-world-v2 # PyTorch ≥2.4 필요 pip install -r requirements.txt # Flash‑Attention는 Transformer 커널을 가속화합니다 pip install flash-attn --no-build-isolation모델 다운로드 – 공개된 체크포인트 중 하나를 선택하세요. 14 B 빠른 모델 예시 (Hugging Face):
pip install "huggingface_hub[cli]" huggingface-cli download robbyant/lingbot-world-v2-14b-causal-fast \ --local-dir ./lingbot-world-v2-14b-causal-fast(1.3 B 모델은 14 B 릴리스와 T5/VAE 토크나이저 및 VAE 가중치를 공유합니다.
--assets_dir로 14 B 폴더를 전달하세요.)추론 실행 – 제공된
generate.py는 비디오 프레임을 청크 단위로 스트리밍하여 메모리 사용량을 낮춥니다.# 예시: 14 B 빠른 모델, 480p 비디오, 8개 GPU torchrun --nproc_per_node=8 generate.py \ --task i2v-A14B \ --size 480*832 \ --ckpt_dir lingbot-world-v2-14b-causal-fast \ --image examples/03/image.jpg \ --action_path examples/03 \ --dit_fsdp --t5_fsdp \ --ulysses_size 8 \ --frame_num 361 \ --local_attn_size 18 --sink_size 6 \ --prompt "A serene lakeside scene …"작은 1.3 B 빠른 모델의 경우
--nproc_per_node=4를 변경하고--assets_dir lingbot-world-v2-14b-causal-fast를 추가하세요.전체 명령어를 직접 입력하는 대신 헬퍼 스크립트
run_fast.sh를 사용할 수 있습니다:bash run_fast.sh lingbot-world-v2-14b-causal-fast 361출력 확인 – 스크립트는
output.mp4와 같은 비디오 파일을 생성하며, 어떤 미디어 플레이어로도 재생할 수 있습니다.
📂 리포지토리 내용
| 폴더/파일 | 목적 |
|---|---|
generate.py |
주요 추론 스크립트 (인과적 KV 캐시, 청크 기반 비디오 생성) |
run_fast.sh |
GPU 수와 모델 크기를 체크포인트 이름에서 자동 감지하는 편의성 래퍼 |
requirements.txt |
Python 종속성 (torch, transformers, flash‑attention 등) |
examples/ |
데모 프롬프트에서 사용되는 샘플 이미지 및 액션 경로 파일 |
README.md (이 파일) |
문서, 모델 다운로드 표, 빠른 시작 가이드 |
코드는 Wan2.2 (비디오 디퓨전 프레임워크) 기반으로 구축되었습니다. Wan2.2의 완전한 설치 세부 정보는 해당 리포지토리에서 확인하세요.
📦 사용 가능한 모델 체크포인트
| 모델 | 크기 | 유형 | 다운로드 위치 |
|---|---|---|---|
lingbot-world-v2-14b-causal-fast |
14 B | 실시간 소규모화 (빠른) | 🤗 [HuggingFace] & 🤖 [ModelScope] |
lingbot-world-v2-14b-causal-pretrain |
14 B | 인과적 사전 훈련 (고품질, 느림) | 🤗 [HuggingFace] |
lingbot-world-v2-14b-bid |
14 B | 양방향 (연구용) | 🤗 [HuggingFace] |
lingbot-world-v2-1.3b-causal-fast |
1.3 B | 경량 빠른 버전 | 🤗 [HuggingFace] |
모든 모델은 CC BY‑NC‑SA 4.0 (비영리 사용만 허용) 라이선스로 배포됩니다. 1.3 B 패키지는 현재 디퓨전 (DiT) 가중치만 포함하며, 토크나이저, T5 인코더, VAE는 14 B 릴리스와 공유됩니다.
🌐 온라인 체험하기
- 국제 웹 데모 – Reactor에서 호스팅: https://www.reactor.inc/lingbot-world-v2
- 국내 모바일 데모 – LingGuang에서 호스팅: https://www.lingguang.com/support
두 플랫폼 모두 실시간으로 전체 기능 모델을 실행합니다. 공식 데모는 WAIC 2026 컨퍼런스용으로, README 내 링크에서 확인 가능합니다.
📚 관련 연구 및 인용
- 원본 LingBot‑World 프로젝트: https://github.com/robbyant/lingbot-world
- 기술 보고서 (arXiv): https://arxiv.org/abs/2607.07534
- 연구에서 모델을 사용할 경우 다음을 인용해 주세요:
@article{lingbot-world-v2, title={Infinite Worlds with Versatile Interactions}, author={Zelin Gao and Qiuyu Wang and Jiapeng Zhu and Jingye Chen and Zichen Liu and Qingyan Bai and Jiahao Wang and Yufeng Yuan and Hanlin Wang and Yichong Lu and Ka Leong Cheng and Haojie Zhang and Jian Gao and Tianrui Feng and Yuzheng Liu and Yao Yao and Yinghao Xu and Xing Zhu and Yujun Shen and Hao Ouyang}, journal={arXiv preprint arXiv:2607.07534}, year={2026} }
📄 라이선스
코드 및 모델 가중치는 Creative Commons Attribution‑NonCommercial‑ShareAlike 4.0 International 라이선스 하에 배포됩니다. 비영리 목적을 위해 자료를 공유 및 수정할 수 있으며, 적절한 출처 표시와 파생 저작물을 동일한 라이선스로 배포해야 합니다.
TL;DR
- 무엇입니까: 무한히 진화하는 가상 세계를 실시간 및 고품질 버전으로 생성하는 비디오 생성 모델입니다.
- 왜 중요한가: 장기간에 걸쳐 텍스트 명령에 반응하는 인터랙티브 AI 기반 시뮬레이션, 게임, 가상 환경 연구를 가능하게 합니다.
- 시작 방법: 종속성 설치, 체크포인트 다운로드, 프롬프트와 소스 이미지로
generate.py(또는run_fast.sh) 실행. - 체험 장소: Reactor (웹) 및 LingGuang (모바일)에서 실시간 데모를 확인할 수 있습니다.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- 프로젝트