nvidia-cosmos/cosmos-rl

Cosmos-RL is a flexible and scalable Reinforcement Learning framework specialized for Physical AI applications.

解決的問題

Cosmos-RL 是專為應對物理 AI 應用的大規模強化學習(RL)訓練複雜性而設計,提供一個可擴展且彈性的框架,用以管理具身智能體訓練所帶來的高計算負載。

工作原理

該框架採用解耦的單控制器架構,將訓練過程劃分為專門的角色:

  • 策略(消費者): 專用於訓練實例的副本。
  • 回放(生產者): 專用於生成引擎的副本。
  • 控制器: 一個高效的通訊系統,協調策略副本與回放副本之間的權重與回放資料。

為最大化效能,支援多種並行策略(Tensor、Sequence、Context、FSDP 和 Pipeline),並利用低精度訓練與回放(FP8 和 FP4)以減少記憶體與計算開銷。

適用對象

面向從事物理 AI 研究的開發者與研究人員,例如機器人、自動駕駛車輛與智慧空間領域,需要實現大規模強化學習訓練負載的使用者。

核心亮點

  • 高階並行化: 支援五種不同類型的並行策略,可在 GPU 間分散工作負載。
  • 異步架構: 解耦策略與回放副本,提升整體效率。
  • 彈性訓練: 使用動態 NCCL 進程群組,支援 GPU 在執行時動態註冊或註銷,確保容錯能力。
  • 低精度支援: 對 FP8 和 FP8/FP4 精度進行優化,加速訓練與回放過程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案