Robbyant/lingbot-video

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

解决的问题

LingBot-Video 旨在弥合视频合成与物理世界理解之间的差距,特别针对具身智能(embodied intelligence)设计。其目标是生成高质量、物理上合理且任务导向的视频,超越简单的美学视频生成,以支持机器人学和具身人工智能的需求。

工作原理

该项目采用大规模的混合专家(MoE)架构,能够在保持高效推理(比密集模型快约3倍)的同时实现高模型容量。它在海量网络视频数据的基础上,结合了超过7万小时的专业具身数据进行训练。为确保质量,采用了多奖励机制,优化美学、物理合理性以及任务完成度。

适用人群

该工具主要面向从事具身智能、机器人学和视频生成的研究人员与开发者,以及需要处理复杂物理交互的高性能开源视频模型的用户。

核心亮点

  • MoE 架构:从零开始扩展,平衡容量与成本。
  • 具身数据引擎:整合了7万+小时的具身专用视频数据。
  • 多任务支持:支持文本到图像(T2I)、文本到视频(T2V)以及文本到图像到视频(TI2V)。
  • 结构化提示:使用基于 Qwen3.6 的专用提示重写器,将自然语言转换为结构化 JSON 字幕,实现更精准控制。
  • 高性能表现:在 RBench 基于具身视频生成的排行榜中位列顶尖。

相关

  • 项目
  • 项目
  • 项目
  • Dispatch
  • 项目