RLinf/RLinf

RLinf: Reinforcement Learning Infrastructure for Embodied and Agentic AI

解決的問題

RLinf 提供一個可擴展且彈性的強化學習(RL)訓練基礎設施,特別針對具身智能(機器人)與智能體智能(Agentic AI)。它消除分散式程式設計的複雜性,讓開發者無需修改程式碼即可在多個 GPU 節點上擴展訓練,並優化高效率 RL 訓練的吞吐量。

工作原理

RLinf 作為強化學習訓練的穩健骨幹,支援多種演算法(如 PPO、GRPO 和 SAC),並與多種後端(如 FSDP、HuggingFace、SGLang 和 vLLM)整合。它採用混合執行模式以提升具身強化學習的吞吐量,並支援廣泛的加速器,包括 NVIDIA GPU、摩爾線程(MUSA)、華為昇騰(CANN)與 AMD(ROCm)。

適用對象

專為從事視覺-語言-動作(VLA)模型、機器人策略學習與智能體 AI 的研究人員與開發者設計,適用於需要處理大規模分散式訓練與真實機器人部署的系統需求。

主要亮點

  • 廣泛的硬體支援:相容 NVIDIA、AMD、華為昇騰與摩爾線程加速器。
  • 豐富的模擬器整合:支援 Isaac Lab、LIBERO、RoboCasa、Metaworld 等多種模擬器。
  • 真實世界能力:包含 RLinf-USER,可在 Franka 與 XSquare Turtle2 等實體機器人上進行線上策略學習。
  • 系統優化:提供 DynaRL 實現動態計算資源重分配,以及 FUSCO 加速 MoE 通訊。
  • 多樣的 RL 支援:涵蓋從離線 IQL 和 SFT 到線上 RL 與大模型 GRPO 微調的完整流程。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案