areal-project/AReaL

The RL Bridge for LLM-based Agent Applications. Made Simple & Flexible.

AReaL – 大规模异步强化学习系统

什么是 AReaL AReaL 是一个用于大规模训练强化学习 (RL) 智能体的开源框架。它由清华大学和蚂蚁集团的研究人员开发,专注于全异步训练,这使得许多工作节点可以在无需互相等待的情况下生成经验并更新模型权重。这种设计提供了更高的吞吐量和更低的成本,特别是在训练大型推理或智能体模型时。

核心优势

特性 为什么它很重要
灵活性 您只需通过更改 base_url 即可接入任何黑盒智能体(例如 OpenAI Agents, CAMEL-AI, 自定义 API)。
可扩展性 异步流水线可以在多个 GPU 或 Ray 集群上运行,支持 Megatron, PyTorch FSDP 和 Huawei Ascend NPU 后端。
性能 据报道,相比同步基准测试,速度提升高达 2.8 倍,并在数学、编程、搜索和客户服务任务中取得了最先进的结果。
模块化服务 (AReaL 2.0) 训练、推理、智能体、权重更新是独立的微服务,使得在云端(GCP, AWS, Kubernetes via SkyPilot)部署变得非常简单。

关键算法(均提供异步和同步模式):GRPO, GSPO, PPO, DAPO, LitePPO, Dr-GRPO, REINFORCE++, RLOO, SAPO, IcePop, KPop, M2PO, DPO, RLHF 奖励建模, SFT, 蒸馏等。

典型工作负载

  • 数学与推理 – GSM8K, 多轮数学, 倒计时游戏, LoRA 高效训练。
  • 智能体强化学习 (Agentic RL) – 通用智能体, 在线 RL 循环 (Hermes), 编程智能体 (SWE), 搜索智能体, 工具集成推理, OpenAI Agents, CAMEL-AI。
  • 视觉-语言 – Geometry3K, 使用 Qwen-VL 模型进行 CLEVR-Count, NPU 加速的 VLM 训练。
  • 对齐 – RLHF 的奖励建模, 蒸馏流水线。
  • 云端 / 边缘部署 – SkyPilot 集成, NPU 支持。

入门指南 (来自 README)

# clone and install
git clone https://github.com/areal-project/AReaL && cd AReaL
pip install uv
# install flash-attention wheel (choose matching wheel)
uv pip install "https://github.com/mjun0812/flash-attention-prebuild-wheels/releases/download/v0.7.16/flash_attn-2.8.3+cu128torch2.9-cp312-cp312-linux_x86_64.whl"
uv sync --extra cuda   # adds training packages + SGLang (default inference backend)
# single-node run (GSM8K math example)
python3 examples/math/gsm8k_rl.py --config examples/math/gsm8k_grpo.yaml scheduler.type=local

对于 Ray 集群,请添加 cluster.n_nodes, cluster.n_gpus_per_node 以及共享存储路径,然后设置 scheduler.type=ray

文档与社区

  • 完整文档:https://areal-project.github.io/AReaL/
  • 中文文档、微信群和社区会议录像均可在仓库中找到链接。
  • Hugging Face 上的模型与数据集集合 (🤗 Models & Data)。
  • 最近的发布包括 AReaL 2.0 (微服务架构) 和 AReaL-lite (轻量级版本)。

谁应该使用它 构建大规模 RL 智能体的研究人员和工程师——特别是那些需要异步流水线、多 GPU/NPU 扩展或与现有 LLM 后端集成的用户——会发现 AReaL 是一个拥有许多示例配方的即插即用平台。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目