areal-project/AReaL
The RL Bridge for LLM-based Agent Applications. Made Simple & Flexible.
AReaL – 大規模非同期強化学習システム
What it is AReaLは、大規模な強化学習 (RL) エージェントをトレーニングするためのオープンソースフレームワークです。清華大学と Ant Group の研究者によって開発され、fully asynchronous(完全非同期)トレーニングに焦点を当てています。これにより、多くのワーカーが互いに待ち合わせることなく、経験を生成しモデルの重みを更新できます。この設計により、特に大規模な推論またはエージェントモデルのトレーニングにおいて、高いスループットと低コストを実現します。
Core strengths
| Feature | Why it matters |
|---|---||
| Flexibility | base_url を変更するだけで、あらゆるブラックボックス・エージェント(例:OpenAI Agents, CAMEL-AI, custom APIs)をプラグインできます。|
| Scalability | 非同期パイプラインは複数の GPU または Ray クラスター上で動作し、Megatron, PyTorch FSDP, および Huawei Ascend NPU バックエンドをサポートしています。|
| Performance | 同期ベースラインと比較して最大 2.8x の高速化が報告されており、数学、コーディング、検索、およびカスタマーサービス業務において SOTA (state-of-the-art) の結果を出力します。|
| Modular services (AReaL 2.0) | トレーニング、推論、エージェント、および重み更新は個別のマイクロサービスであり、クラウド (GCP, AWS, Kubernetes via SkyPilot) への展開がスムーズです。|
Key algorithms (all have async and sync modes): GRPO, GSPO, PPO, DAPO, LitePPO, Dr-GRPO, REINFORCE++, RLOO, SAPO, IcePop, KPop, M2PO, DPO, RLHF reward modeling, SFT, distillation, etc.
Typical workloads
- Math & reasoning – GSM8K, multi-turn math, countdown games, LoRA-efficient training.
- Agentic RL – General agents, online RL loops (Hermes), coding agents (SWE), search agents, tool-integrated reasoning, OpenAI Agents, CAMEL-AI.
- Vision-language – Geometry3K, CLEVR-Count with Qwen-VL models, NPU-accelerated VLM training.
- Alignment – Reward modeling for RLHF, distillation pipelines.
- Cloud / edge deployment – SkyPilot integration, NPU support.
Getting started (from the README)
# clone and install
git clone https://github.com/areal-project/AReaL && cd AReaL
pip install uv
# install flash-attention wheel (choose matching wheel)
uv pip install "https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.8.3+cu128torch2.9-cp312-cp312-linux_x86_64.whl"
uv sync --extra cuda # adds training packages + SGLang (default inference backend)
# single-node run (GSM8K math example)
python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local
Ray クラスターの場合は、cluster.n_nodes, cluster.n_gpus_per_node, および共有ストレージパスを追加し、scheduler.type=ray に設定してください。
Documentation & community
- Full docs: https://areal-project.github.io/AReaL/
- 中国語ドキュメント、WeChat group、およびコミュニティミーティングの録画はリポジトリ内にリンクされています。
- Hugging Face (🤗 Models & Data) 上のモデル & データコレクション。
- 最近のリリースには AReaL 2.0 (マイクロサービスアーキテクチャ) と AReaL-lite (軽量版) が含まれます。
Who should use it 大規模な RL エージェントを構築する研究者やエンジニア、特に非同期パイプライン、マルチ GPU/NPU スケーリング、または既存の LLM バックエンドとの統合が必要な方は、AReaL を多くのエージェント例を含む準備済みプラットフォームとして活用できます。
関連
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト
- プロジェクト