Robbyant/lingbot-video

Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence

何を解決するか

LingBot-Video は、ビデオ合成と物理世界の理解の間のギャップを埋めるように設計されており、特に身体的な知能(embodied intelligence)を対象としています。高品質で物理的に合理的かつタスク指向の動画を生成することを目指しており、単なる美的な動画生成を越えて、ロボット工学や身体的なAIのニーズを支援します。

動作方法

このプロジェクトは、大規模なMixture-of-Experts(MoE)アーキテクチャを使用しており、高いモデル容量を維持しつつ、効率的な推論(密なモデルと比較して約3倍速)を実現しています。膨大なウェブ動画データに加え、7万時間以上の専門的な身体的データを用いて訓練されています。品質を確保するため、美しさ、物理的合理性、タスク完了の3つの観点から最適化するマルチリワードシステムを採用しています。

対象ユーザー

このツールは、身体的な知能、ロボット工学、動画生成に取り組む研究者や開発者、また複雑な物理的相互作用を扱える高性能なオープンソース動画モデルを探している人にとって適しています。

特徴

  • MoEアーキテクチャ:スケーリングを完全に新規から行い、容量とコストのバランスを最適化。
  • 身体的データエンジン:7万時間以上の身体的特化型動画データを統合。
  • マルチタスク対応:Text-to-Image(T2I)、Text-to-Video(T2V)、Text-to-Image-to-Video(TI2V)をサポート。
  • 構造化プロンプト:自然言語を構造化されたJSONキャプションに変換する専用プロンプトリライター(Qwen3.6ベース)を使用し、より良い制御を実現。
  • 高パフォーマンス:身体的動画生成においてRBenchリーダーボードでトップクラスの評価を獲得。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • Dispatch
  • プロジェクト