ReinFlow/ReinFlow
[NeurIPS 2025] Flow x RL. "ReinFlow: Fine-tuning Flow Policy with Online Reinforcement Learning". Support VLAs e.g., Pi0, Pi0.5, GR00TN1.5. Fully open-sourced.
What it solves
ReinFlow は、オンライン強化学習 (RL) を用いてフローマッチングポリシー(通常は模倣学習で訓練される)を微調整する難しさに対処します。特に、ポリシーが非常に少ないデノイジングステップ(例: 1〜4 ステップ)しか使用しない場合でも、勾配ベースの最適化のためにポリシー確率を扱いやすくする問題を解決し、離散化やモンテカルロ近似誤差に対してロバストにします。
How it works
ReinFlow は、事前学習済みのフローポリシーを微調整するポリシー勾配フレームワークです。通常は、模倣学習(行動クローン)でフローポリシーを訓練することから始まります。その後、ReinFlow がオンライン RL を適用してポリシーをさらに最適化します。核心となるイノベーションは、デノイジングステップ数に関係なくモデルがポリシー確率を正確に計算できるようにするエンドツーエンドのノイズ注入ネットワークの訓練です。
Who it’s for
ロボット制御や具現化 AI に取り組む研究者・開発者向けに設計されており、特に 1‑Rectified Flow や Shortcut Models などのフローベースポリシーを用いて、脚部歩行、状態ベース操作、視覚操作といったタスクを行う方に適しています。
Highlights
- Broad Compatibility: Supports 1-Rectified Flow, Shortcut Models, and other ODE-defined policies.
- VLA Model Support: Capable of fine-tuning large Vision-Language-Action (VLA) models, including NVIDIA's GR00T and $\pi_0/\pi_{0.5}$.
- Efficiency: Enables effective RL fine-tuning with very few denoising steps (1, 2, or 4).
- Proven Performance: Demonstrated success across diverse robotic benchmarks including OpenAI Gym, Franka Kitchen, and Robomimic.