NovaSky-AI/SkyRL

SkyRL: A Modular Full-stack RL Library for LLMs

解决的问题

SkyRL 是一个模块化全栈库,旨在使大语言模型(LLMs)的强化学习(RL)更加可访问和高效。它特别解决了训练能够处理长时程、现实世界任务的智能体的挑战,这些任务涉及多轮工具使用,例如编程、SQL 生成和终端交互。

工作原理

SkyRL 由多个专用组件组成:

  • skyrl:一个用于本地硬件上 RL 训练的统一库,结合了模块化训练框架(skyrl-train)和 Tinker API 的跨平台后端(skyrl-tx)。
  • skyrl-agent:专注于优化和扩展多轮工具使用 LLM 在长时程任务上的流水线的智能体层。
  • skyrl-gym:使用 Gymnasium API 实现的 RL 环境集合,提供数学、编程、搜索和 SQL 等任务。

适用人群

该库专为构建 RL 调优 LLM 的 AI 研究人员和开发者设计,尤其适用于关注代理工作流、工具使用能力以及长时程问题求解的用户。

主要亮点

  • Tinker API 支持:实现了 Tinker API 的后端,允许用户在自己的 GPU 上运行为该 API 编写的训练脚本。
  • 模块化架构:提供独立的训练框架、代理层和环境库(Gymnasium API)。
  • 长时程聚焦:针对 SWE-Bench 和终端使用智能体等现实世界任务进行了优化。
  • 在线策略蒸馏:支持高级 RL 技术,如在线策略蒸馏和带有飞行中权重更新的完全异步 RL。

相关

  • 项目
  • 项目
  • 项目
  • 项目
  • 项目