NovaSky-AI/SkyRL

SkyRL: A Modular Full-stack RL Library for LLMs

解決的問題

SkyRL 是一個模組化全棧式程式庫,旨在讓大語言模型(LLMs)的強化學習(RL)更易於存取且高效。它特別針對訓練能處理長時程、現實世界任務的智能體所面臨的挑戰,這些任務涉及多輪工具使用,例如程式設計、SQL 產生與終端互動。

如何運作

SkyRL 由幾個專用元件組成:

  • skyrl:一個用於本地硬體上 RL 訓練的整合式程式庫,結合了模組化訓練框架(skyrl-train)與 Tinker API 的跨平台後端(skyrl-tx)。
  • skyrl-agent:專注於優化與擴展多輪工具使用 LLM 在長時程任務上的流程的智能體層。
  • skyrl-gym:使用 Gymnasium API 實作的 RL 環境集合,提供數學、程式設計、搜尋與 SQL 等任務。

適用對象

此程式庫專為開發 RL 調校 LLM 的 AI 研究人員與開發者設計,特別適合關注代理工作流程、工具使用能力與長時程問題解決的使用者。

主要特色

  • Tinker API 支援:實作了 Tinker API 的後端,讓使用者能在自己的 GPU 上執行為該 API 所撰寫的訓練腳本。
  • 模組化架構:提供獨立的訓練框架、代理層與環境庫(Gymnasium API)。
  • 長時程導向:針對 SWE-Bench 與終端使用代理等現實世界任務進行優化。
  • 線上策略蒸餾:支援進階的 RL 技術,如線上策略蒸餾與具飛行中權重更新的完全非同步 RL。

相關

  • 專案
  • 專案
  • 專案
  • 專案
  • 專案