ReinFlow/ReinFlow

[NeurIPS 2025] Flow x RL. "ReinFlow: Fine-tuning Flow Policy with Online Reinforcement Learning". Support VLAs e.g., Pi0, Pi0.5, GR00TN1.5. Fully open-sourced.

What it solves

ReinFlow 解决了使用在线强化学习 (RL) 微调流匹配策略(通常通过模仿学习训练)的难题。它特别解决了即使策略只使用极少的去噪步骤(例如 1 到 4 步),仍能使策略概率对梯度优化保持可处理的问题,从而对离散化和蒙特卡罗近似误差具有鲁棒性。

How it works

ReinFlow 是一个策略梯度框架,用于微调预训练的流策略。过程通常从使用模仿学习(行为克隆)训练流策略开始。随后 ReinFlow 通过在线 RL 进一步优化策略。核心创新在于训练一个端到端的噪声注入网络,使模型无论使用多少去噪步骤都能准确计算策略概率。

Who it’s for

它面向从事机器人控制和具身 AI 的研究者和开发者,特别是使用基于流的策略(如 1‑Rectified Flow 或 Shortcut Models)进行腿部运动、基于状态的操作和视觉操作等任务的人群。

Highlights

  • Broad Compatibility: Supports 1-Rectified Flow, Shortcut Models, and other ODE-defined policies.
  • VLA Model Support: Capable of fine-tuning large Vision-Language-Action (VLA) models, including NVIDIA's GR00T and $\pi_0/\pi_{0.5}$.
  • Efficiency: Enables effective RL fine-tuning with very few denoising steps (1, 2, or 4).
  • Proven Performance: Demonstrated success across diverse robotic benchmarks including OpenAI Gym, Franka Kitchen, and Robomimic.