nvidia-cosmos/cosmos-rl
Cosmos-RL is a flexible and scalable Reinforcement Learning framework specialized for Physical AI applications.
解決的問題
Cosmos-RL 是專為應對物理 AI 應用的大規模強化學習(RL)訓練複雜性而設計,提供一個可擴展且彈性的框架,用以管理具身智能體訓練所帶來的高計算負載。
工作原理
該框架採用解耦的單控制器架構,將訓練過程劃分為專門的角色:
- 策略(消費者): 專用於訓練實例的副本。
- 回放(生產者): 專用於生成引擎的副本。
- 控制器: 一個高效的通訊系統,協調策略副本與回放副本之間的權重與回放資料。
為最大化效能,支援多種並行策略(Tensor、Sequence、Context、FSDP 和 Pipeline),並利用低精度訓練與回放(FP8 和 FP4)以減少記憶體與計算開銷。
適用對象
面向從事物理 AI 研究的開發者與研究人員,例如機器人、自動駕駛車輛與智慧空間領域,需要實現大規模強化學習訓練負載的使用者。
核心亮點
- 高階並行化: 支援五種不同類型的並行策略,可在 GPU 間分散工作負載。
- 異步架構: 解耦策略與回放副本,提升整體效率。
- 彈性訓練: 使用動態 NCCL 進程群組,支援 GPU 在執行時動態註冊或註銷,確保容錯能力。
- 低精度支援: 對 FP8 和 FP8/FP4 精度進行優化,加速訓練與回放過程。
相關
- 專案
- 專案
- 專案
- 專案
- 專案