ReinFlow/ReinFlow

[NeurIPS 2025] Flow x RL. "ReinFlow: Fine-tuning Flow Policy with Online Reinforcement Learning". Support VLAs e.g., Pi0, Pi0.5, GR00TN1.5. Fully open-sourced.

What it solves

ReinFlow는 온라인 강화 학습(RL)을 사용해 흐름 매칭 정책(대부분 모방 학습으로 훈련됨)을 미세 조정하는 어려움을 해결합니다. 특히 정책이 매우 적은 디노이징 단계(예: 1~4 단계)만 사용할 때도 정책 확률을 그래디언트 기반 최적화에 사용할 수 있게 만들어, 이산화 및 몬테카를로 근사 오류에 강인하도록 합니다.

How it works

ReinFlow는 사전 학습된 흐름 정책을 미세 조정하는 정책 그라디언트 프레임워크입니다. 일반적으로 행동 클로닝(모방 학습)으로 흐름 정책을 훈련하는 것으로 시작합니다. 이후 ReinFlow가 온라인 RL을 적용해 정책을 추가 최적화합니다. 핵심 혁신은 디노이징 단계 수와 관계없이 모델이 정책 확률을 정확히 계산할 수 있게 하는 엔드‑투‑엔드 노이즈 주입 네트워크를 학습하는 것입니다.

Who it’s for

이 프레임워크는 로봇 제어 및 구현 AI에 종사하는 연구자와 개발자를 위해 설계되었으며, 특히 1‑Rectified Flow 또는 Shortcut Models와 같은 흐름 기반 정책을 사용해 다리 보행, 상태 기반 조작, 시각 조작 등의 작업을 수행하는 사람들을 대상으로 합니다.

Highlights

  • Broad Compatibility: Supports 1-Rectified Flow, Shortcut Models, and other ODE-defined policies.
  • VLA Model Support: Capable of fine-tuning large Vision-Language-Action (VLA) models, including NVIDIA's GR00T and $\pi_0/\pi_{0.5}$.
  • Efficiency: Enables effective RL fine-tuning with very few denoising steps (1, 2, or 4).
  • Proven Performance: Demonstrated success across diverse robotic benchmarks including OpenAI Gym, Franka Kitchen, and Robomimic.