areal-project/AReaL

The RL Bridge for LLM-based Agent Applications. Made Simple & Flexible.

AReaL – 大規模非同期強化学習システム

What it is AReaLは、大規模な強化学習 (RL) エージェントをトレーニングするためのオープンソースフレームワークです。清華大学と Ant Group の研究者によって開発され、fully asynchronous(完全非同期)トレーニングに焦点を当てています。これにより、多くのワーカーが互いに待ち合わせることなく、経験を生成しモデルの重みを更新できます。この設計により、特に大規模な推論またはエージェントモデルのトレーニングにおいて、高いスループットと低コストを実現します。

Core strengths | Feature | Why it matters | |---|---|| | Flexibility | base_url を変更するだけで、あらゆるブラックボックス・エージェント(例:OpenAI Agents, CAMEL-AI, custom APIs)をプラグインできます。| | Scalability | 非同期パイプラインは複数の GPU または Ray クラスター上で動作し、Megatron, PyTorch FSDP, および Huawei Ascend NPU バックエンドをサポートしています。| | Performance | 同期ベースラインと比較して最大 2.8x の高速化が報告されており、数学、コーディング、検索、およびカスタマーサービス業務において SOTA (state-of-the-art) の結果を出力します。| | Modular services (AReaL 2.0) | トレーニング、推論、エージェント、および重み更新は個別のマイクロサービスであり、クラウド (GCP, AWS, Kubernetes via SkyPilot) への展開がスムーズです。|

Key algorithms (all have async and sync modes): GRPO, GSPO, PPO, DAPO, LitePPO, Dr-GRPO, REINFORCE++, RLOO, SAPO, IcePop, KPop, M2PO, DPO, RLHF reward modeling, SFT, distillation, etc.

Typical workloads

  • Math & reasoning – GSM8K, multi-turn math, countdown games, LoRA-efficient training.
  • Agentic RL – General agents, online RL loops (Hermes), coding agents (SWE), search agents, tool-integrated reasoning, OpenAI Agents, CAMEL-AI.
  • Vision-language – Geometry3K, CLEVR-Count with Qwen-VL models, NPU-accelerated VLM training.
  • Alignment – Reward modeling for RLHF, distillation pipelines.
  • Cloud / edge deployment – SkyPilot integration, NPU support.

Getting started (from the README)

# clone and install
git clone https://github.com/areal-project/AReaL && cd AReaL
pip install uv
# install flash-attention wheel (choose matching wheel)
uv pip install "https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.8.3+cu128torch2.9-cp312-cp312-linux_x86_64.whl"
uv sync --extra cuda   # adds training packages + SGLang (default inference backend)
# single-node run (GSM8K math example)
python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local

Ray クラスターの場合は、cluster.n_nodes, cluster.n_gpus_per_node, および共有ストレージパスを追加し、scheduler.type=ray に設定してください。

Documentation & community

  • Full docs: https://areal-project.github.io/AReaL/
  • 中国語ドキュメント、WeChat group、およびコミュニティミーティングの録画はリポジトリ内にリンクされています。
  • Hugging Face (🤗 Models & Data) 上のモデル & データコレクション。
  • 最近のリリースには AReaL 2.0 (マイクロサービスアーキテクチャ) と AReaL-lite (軽量版) が含まれます。

Who should use it 大規模な RL エージェントを構築する研究者やエンジニア、特に非同期パイプライン、マルチ GPU/NPU スケーリング、または既存の LLM バックエンドとの統合が必要な方は、AReaL を多くのエージェント例を含む準備済みプラットフォームとして活用できます。

関連

  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト
  • プロジェクト