areal-project/AReaL

The RL Bridge for LLM-based Agent Applications. Made Simple & Flexible.

AReaL – 大規模非同步強化學習系統

什麼是 AReaL AReaL 是一個用於大規模訓練強化學習 (RL) 代理的開源框架。它由清華大學和螞蟻集團的研究人員開發,專注於完全非同步訓練,這讓許多工作節點可以在不互相等待的情況下生成經驗並更新模型權重。這種設計提供了更高的吞吐量和更低的成本,特別是在訓練大型推理或代理模型時。

核心優勢

特性 為什麼重要
靈活性 您只需透過更改 base_url 即可接入任何黑盒代理(例如 OpenAI Agents, CAMEL-AI, 自定義 API)。
可擴展性 非同步流水線可在多個 GPU 或 Ray 集群上運行,支持 Megatron, PyTorch FSDP, 以及華為 Ascend NPU 後端。
性能 據報導,相較於同步基準測試,速度提升高達 2.8 倍,並在數學、編碼、搜索和客戶服務任務中取得了尖端結果。
模組化服務 (AReaL 2.0) 訓練、推理、代理和權重更新是獨立的微服務,使得在雲端(GCP, AWS, Kubernetes 透過 SkyPilot)部署變得非常簡單。

關鍵算法(皆具備非同步與同步模式):GRPO, GSPO, PPO, DAPO, LitePPO, Dr-GRPO, REINFORCE++, RLOO, SAPO, IcePop, KPop, M2PO, DPO, RLHF 獎勵建模, SFT, 蒸餾, 等等。

典型工作負載

  • 數學與推理 – GSM8K, 多輪數學, 倒數遊戲, LoRA-高效訓練。
  • 代理型 RL – 通用代理, 線上 RL 循環 (Hermes), 編碼代理 (SWE), 搜索代理, 工具集成推理, OpenAI Agents, CAMEL-AI。
  • 視覺-語言 – Geometry3K, CLEVR-Count 搭配 Qwen-VL 模型, NPU 加速的 VLM 訓練。
  • 對齊 – RLHF 的獎勵建模, 蒸餾流水線。
  • 雲端 / 邊緣部署 – SkyPilot 集成, NPU 支持。

入門指南 (來自 README)

# clone and install
git clone https://github.com/areal-project/AReaL && cd AReaL
pip install uv
# install flash-attention wheel (choose matching wheel)
uv pip install "https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.8.3+cu128torch2.9-cp312-cp312-linux_x86_64.whl"
uv sync --extra cuda   # adds training packages + SGLang (default inference backend)
# single-node run (GSM8K math example)
python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local

對於 Ray 集群,請添加 cluster.n_nodes, cluster.n_gpus_per_node, 以及共享存儲路徑,然後設置 scheduler.type=ray

文件與社區

  • 完整文檔:https://areal-project.github.io/AReaL/
  • 中文文檔、WeChat 群組以及社區會議錄影已在倉庫中提供鏈接。
  • Hugging Face 上的模型與數據集 (🤗 Models & Data)。
  • 最近的發布包含 AReaL 2.0 (微服務架構) 和 AReaL-lite (輕量級版本)。

誰應該使用它 研究人員和工程師在構建大規模 RL 代理時——特別是那些需要非同步流水線、多-GPU/NPU 擴展,或與現有 LLM 後端集成時——會發現 AReaL 是一個擁有許多範例配方的現成可用平台。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案