Robbyant/lingbot-video
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
解決的問題
LingBot-Video 是專為彌合視頻合成與物理世界理解之間的差距而設計,特別針對具身智能(embodied intelligence)而打造。其目標是生成高品質、物理上合理且任務導向的視頻,超越單純的美學視頻生成,以支援機器人學與具身人工智慧的需求。
工作原理
本專案採用大規模混合專家(MoE)架構,能在維持高效推論(比密集模型快約3倍)的同時實現高模型容量。訓練資料涵蓋龐大的網路視頻資料集,並結合超過7萬小時的專業具身資料。為確保品質,採用多獎勵系統,優化美學、物理合理性與任務完成度。
適用對象
此工具主要適用於從事具身智能、機器人學與視頻生成的研究人員與開發者,以及尋找能處理複雜物理互動之高性能量子開源視頻模型的使用者。
核心亮點
- MoE 架構:從零開始擴展,平衡容量與成本。
- 具身資料引擎:整合7萬+小時的具身專用視頻資料。
- 多任務支援:支援文字轉圖像(T2I)、文字轉視頻(T2V)以及文字轉圖像轉視頻(TI2V)。
- 結構化提示:使用基於 Qwen3.6 的專用提示重寫器,將自然語言轉換為結構化 JSON 字幕,實現更精準控制。
- 高性能量表現:在 RBench 基於具身視頻生成的排行榜中位居頂尖。
相關
- 專案
- 專案
- 專案
- Dispatch
- 專案