inclusionAI/AReno

An easy-to-use, fast toolkit to scale up RL post-training on a single node.

解决的问题

AReno 旨在通过提供一个自包含的单节点工具包,使 LLM 强化学习(RL)和后训练更加易用。它消除了对复杂集群设置、独立推理服务器或碎片化训练框架的需求,使开发者能够在一台机器上从基础模型检查点直接完成训练并部署模型。

如何工作

AReno 采用全栈设计,针对单节点性能进行了优化。它提供了一个 Trainer 类和 CLI,可处理整个 RL 循环:生成在线策略完成(rollout)、通过用户定义的奖励函数进行评分,并更新模型权重(训练)。它原生支持 CUDA(Linux)和 MLX(Apple Silicon)后端。

适用人群

专为希望使用 RL、SFT 或 DPO 风格训练,在无需管理大规模基础设施的前提下,快速在本地完成 LLM 后训练的研究人员和开发者设计。

主要亮点

  • 即插即用:通过简单的 --algo 标志或 Python API 即可访问各种后训练算法。
  • 支持智能体 RL:支持通过与本地 OpenAI 兼容代理交互,并从轨迹中训练智能体。
  • 多模态支持:使用 OpenAI 风格的消息格式,兼容图像、音频和视频内容。
  • 硬件灵活性:原生支持通过 CUDA 的 NVIDIA GPU 和通过 MLX 的 Apple Silicon。
  • 集成式服务:内置 OpenAI 兼容服务器,支持连续批处理,可立即部署训练好的模型。
  • 运维智能体:内置 AI 助手(areno agent),帮助用户配置和运行训练命令。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目