Robbyant/lingbot-video
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
해결하는 문제
LingBot-Video는 비디오 합성과 물리 세계 이해 사이의 격차를 메우기 위해 설계되었으며, 특히 몸을 가진 지능(embodied intelligence)을 위한 것입니다. 고품질의 물리적으로 타당하고 작업 중심의 비디오를 생성함으로써 단순한 미적 비디오 생성을 넘어서 로봇공학과 몸을 가진 AI의 요구를 지원합니다.
작동 방식
이 프로젝트는 대규모 Mixture-of-Experts (MoE) 아키텍처를 사용하여 높은 모델 용량을 유지하면서도 효율적인 추론(밀집 모델 대비 약 3배 빠름)을 가능하게 합니다. 웹 비디오 데이터의 막대한 데이터셋과 7만 시간 이상의 전문적인 몸을 가진 데이터를 결합하여 훈련되었습니다. 품질을 보장하기 위해 미적 요소, 물리적 타당성, 작업 완료도를 고려한 다중 보상 시스템을 사용합니다.
대상 사용자
이 도구는 몸을 가진 지능, 로봇공학, 비디오 생성 분야에서 일하는 연구자 및 개발자, 그리고 복잡한 물리적 상호작용을 처리할 수 있는 고성능 오픈소스 비디오 모델을 찾는 사람들에게 적합합니다.
주요 특징
- MoE 아키텍처: 용량과 비용의 균형을 맞추기 위해 처음부터 확장된 구조.
- 몸을 가진 데이터 엔진: 7만 시간 이상의 몸을 가진 전용 비디오 데이터 통합.
- 다중 작업 지원: Text-to-Image (T2I), Text-to-Video (T2V), Text-to-Image-to-Video (TI2V)를 지원.
- 구조화된 프롬프트: 자연어를 구조화된 JSON 캡션으로 변환하는 전용 프롬프트 리라이터(Qwen3.6 기반) 사용으로 더 나은 제어 가능.
- 고성능: 몸을 가진 비디오 생성 분야에서 RBench 리더보드에서 최상위 등급을 기록.
관련
- 프로젝트
- 프로젝트
- 프로젝트
- Dispatch
- 프로젝트